
周五临下班领导在群里问了一句“2022年机房改造的竣工验收材料原件还调得出来吗”你打开共享盘文件夹叫“2022-归档-最终版-改-确定版”点进去还有三个压缩包。翻了二十分钟终于找到目录正文却在另一个盘里。有人说现在AI能一句话查档。你试了三次两次答非所问一次给的是已经作废的版本。所以问题来了——同一个模型写周报、写邮件都挺顺怎么一落到查档案就掉链子一、写材料和查档案压根不是一回事因为这两件事对“错”的容忍度不一样。写材料猜对了是加分猜错了你大概率一眼能看出来删掉重来就是。查档案不一样答案必须指向一份真实存在、唯一确定、还在保管期内的文件——猜对了是本分猜错了没人兜得住。“一句话查档”听着输入很短其实是四个动作的缩写听懂这句话、找到那批文件、判断你有没有资格看、把答案摊到证据旁边。少一步前面省下来的三十分钟都会在验证环节加倍还回去。二、在这之前先把标签补齐这是地基不牢的话四道关只是在给问题加速。多数单位的档案目录是“能用”的档号、题名、日期、页数都有。但AI拿着这套目录做不了判断它还缺三类标签谁能看。密级、开放等级、是否涉密、是否含个人信息。没有这个系统就只剩两个选择全给你或者全不给。管多久。保管期限、到期状态、是否已移交或按规定处置。没有这个答案里就可能混进早过了期的文件。是哪一类。文种、形成部门、关联项目。没有这个“那份验收材料”这种口语提问就没有着力点。补标签没有捷径但也不用一步到位先保住近三年的增量档案再回头啃存量先把“密级、保管期限、形成部门、形成时间”这四个字段填死其余慢慢来。第一道关听懂人话现象。工作里几乎没有标准检索式。“王工去年签的那个合同”“三年前搬办公室那批图纸”——时间模糊、人称代称、用事件指代文件外加一堆简称和黑话。风险。模型只会按普通语义去理解于是“最近”成了最近七天“老系统”指向一个谁也说不清的范围。检索式一旦建歪后面全歪。更麻烦的是它不会说不知道而是自作主张补一个很像的答案。把问题拆成词槽。时间、部门、文种、密级、项目能补几个补几个缺哪个追问哪个。配一张业务词对照表。简称归正式名口语归标准用语。这是本地资产别指望模型自带。不确定就追问。命中多个结果时反问一句“是这三份里的哪一份”比直接甩一个强十倍。第二道关找得到现象。大家默认AI能像人一样“看懂”全文于是把扫描件直接丢进去。结果插图旁边的说明被抓成了正文表格里的数据串了行手写签批一个字没认出来。风险。这一关掉链子典型表现是“它说明明有我翻过去就是没有”——召回靠蒙漏检不报警用户却以为答案是全的。元数据要当资产管。检索再聪明也跳不过著录项。缺字段的条目宁可不进索引也别带着脏数据进去。扫描件单独处理。识别率到不了可用的就退回人工标引别让低质量的识别结果污染答案。盯住覆盖率。定期抽一批已知答案的问题去试看能被正确召回的比例是多少。这个数不涨模型换再贵的也没用。第三道关该不该给你现象。对话框是个极其扁平的入口。人点进系统查东西是先看目录、再点文件权限跟着路径走人在对话框里问一句权限就没了附着点——很多方案在这里默认“进了系统的人都能看”。风险。这是四道关里唯一能把小事变成事故的。一句“把去年所有采购合同找出来”可能同时越过密级、越过部门边界、越过保管期限。涉密档案按规定该怎么管就怎么管这条底线不能让位于体验。鉴权必须在检索之前。先按用户权限把结果池缩小再让模型在里面找答案。反过来做等于先泄后审。最小可用原则。只返回能支撑结论的最小片段必要时做脱敏处理别整篇甩出去。全链路留痕。谁问了什么、命中哪几份、有没有导出都要可查、可回溯并可按国家有关规定向主管部门报告。第四道关敢不敢信现象。摘要写得干干净净看着像真读过。你点开原文比对才发现它把三份文件的片段拼在了一起中间那句关键结论来自一份半年前就被修订的版本。风险。写材料出错你还会改查档案出错你大概率直接拿去用了。这也是开头那个问题的答案——差的不是模型聪明不聪明而是这两件事对“可验证”的要求根本不在一个量级写出来的东西你能判断好坏查出来的东西你只能判断它像不像。答案必须带出处。档号、原文片段、版本时间缺一个都别往外给。能跳转到原文的效果最好。先校验现行有效。有修订版就提示有修订版作废版本要显式标出来不许默默参与检索。不会就说不会。置信度低的直接退回“没找到建议换个说法或转人工”。一句“我不知道”比一段通顺的胡说值钱。三、最后一句话查档不是把搜索框换成对话框它更像一次体检听懂、找到、权限、可溯源四道关缺哪一道前面省下来的时间都会在别处原样还回去。真正难住的从来不是那句话本身而是这句话背后那些年没人认真管过的目录、标签和版本。