部署本地 AI 之前,先写清楚它需要完成什么工作。选型可以围绕一张验收单展开:输入来自哪里、结果交给谁、等待多久可以接受,以及失败后怎样继续工作。
从一个可重复的任务开始
本地模型演示很容易产生错觉。输入一句短问题,答案流畅出现,就像已经具备上线条件。但企业里的任务往往包含长文档、格式要求和连续追问。验收应该从实际操作开始,例如从一份采购说明中提取交货日期、供应商名称与缺失字段,再让业务人员确认结果。
准备一组经授权、完成脱敏的材料,覆盖短输入、长输入、格式混乱、关键信息缺失和互相矛盾的内容。先写人工答案与判定规则,再运行模型。缺失字段应标成待确认,不能为了表格完整而自行补齐。这份样本集会比一张模型排行榜更贴近使用需求。
把“跑得动”拆成四个问题
- 能否稳定完成任务?记录峰值内存、失败原因,以及同时打开日常工作软件后的表现。
- 使用者等多久?分别记录开始出现结果的等待时间和整个任务的完成时间。
- 输出能否直接使用?检查字段正确率、引用位置与人工修改量,保留错误样例。
- 长时间运行是否可接受?观察连续任务时的速度变化、耗电与机器占用,并记录测试环境。
这些指标需要写清模型版本、量化方式、上下文长度、运行工具版本和并发条件。同一台电脑上更换配置之后,应重新测量。把不同条件下的数字并排比较,容易得到漂亮却无用的结论。
llama.cpp 的官方基准说明把提示处理与文本生成分开测试,并说明基准不包含分词和采样时间。因此,工具结果适合帮助定位瓶颈;应用验收仍应从用户点击开始,到可用结果出现为止。
为不满足条件的任务安排出口
例如,短工单分类可以优先本地处理,超过已验证长度的材料进入等待队列,结果不确定时交给人工。只有获得相应的数据传输授权后,才考虑调用外部服务。界面应告诉使用者当前处理方式,不能静默把本地任务转到云端。
验收标准应由业务目标决定。离线整理资料可以接受较长等待,现场接待则需要及时反馈。先写出最长等待时间、允许的错误类型与退出办法,再判断现有配置是否合适,能减少为了配置本身而不断升级的冲动。
最后保留一页实验记录:任务、样本、环境、结果、已知限制和下一次复测条件。做求职作品或独立交付时,这页记录能够展示如何从需求出发做技术判断,也让接手的人知道系统可靠到什么程度。