“小模型更便宜”只有在它能完成任务时才成立。一个分类模型单次推理费用很低,但如果错误把高风险请求送入自动流程,后续人工和事故成本会吞掉节省。小模型的机会不是取代所有大模型,而是占据边界稳定、验证清楚、规模足够的任务。
判断应从任务和目标设备开始:输入多长、输出是否结构化、延迟上限、网络是否可靠、数据能否离开设备、错误能否快速检测。参数量只是影响内存和计算的一项因素。
小并不自动意味着快或省
延迟受模型结构、量化、批处理、推理引擎、内存带宽和硬件支持共同影响。MobileLLM 论文专门研究十亿参数以下模型,说明这一尺度上的架构设计本身会显著影响表现。不能把数据中心的理论算力直接换算成手机体验。
Phi-3 技术报告展示了小型语言模型在特定训练和评测条件下的能力,也明确列出安全与事实性等限制。引用厂商报告时,应保留模型版本、量化和测试条件,不把公开基准外推到自己的业务。
量化会进一步改变内存、速度和质量。相同的 4-bit 标签可能采用不同算法与校准数据,对长文本、数字和少数语言的影响也不同。选型记录必须写明实际权重文件、量化方案和推理引擎,并在该组合上重新跑业务评测。
先设置质量门槛,再比较成本
对意图分类、字段抽取、内容路由和固定格式生成,可以用冻结样本设定最低准确率、关键错误上限和格式通过率。候选模型只有通过门槛,才进入延迟和成本比较。高总分不能抵消少量不可接受错误。
MLPerf Inference在参考质量约束下测量系统性能,提供了同样的工程原则:性能数字必须与质量条件绑定。内部测试还应使用真实硬件和峰值并发,而不是只记录实验室平均值。
批处理、提示缓存和固定前缀可以降低高频任务成本,但会改变延迟与数据隔离。测试应覆盖冷缓存和热缓存、短输入和长输入、单请求和峰值队列,并确认不同租户之间的缓存不会泄露上下文。
| 任务特征 | 建议模型 | 运行位置 | 升级条件 |
|---|---|---|---|
| 固定标签、短输入、可规则校验 | 小模型或传统分类器 | 端侧或低成本服务 | 低置信或未知类别 |
| 结构化抽取、批量高频 | 通过业务评测的小模型 | 批处理服务 | 关键字段冲突 |
| 长上下文、多步判断 | 较强模型 | 云端受控环境 | 直接进入人工复核 |
| 不可逆或高影响决策 | 模型只提供建议 | 审计环境 | 始终由授权人员决定 |
路由策略应通过评测数据调整,不使用模型自报置信度作为唯一依据。
端侧价值来自断网、隐私和即时性
本地运行适合键盘改写、离线摘要、设备指令分类等场景,可以减少网络往返并降低原始数据暴露。但端侧也有设备碎片、内存、功耗、模型分发和升级问题。用户拥有旧设备时,产品必须定义降级行为。
隐私不能只靠“数据不上传”的宣传。仍要说明本地日志、缓存、崩溃报告和模型更新如何处理数据,并测试其他应用或系统权限是否能访问中间文件。
端侧模型还要面对版本分裂。新模型可能只支持部分芯片,旧设备长期留在不同质量水平。产品应记录设备与模型版本,远程关闭有问题版本,并为无法升级的设备保留传统功能,而不是静默返回更差结果。
模型路由需要一个可审计的升级器
常见架构是小模型处理多数简单任务,把困难输入升级到强模型。升级器可以结合规则、输入特征、校验失败和抽样审计,不应完全依赖小模型对自己的置信判断。路由结果要记录,才能发现某类语言或客户被不成比例地升级或误路由。
路由还要防止任务被恶意伪装成低风险请求。例如文本分类结果将决定是否开放写入工具时,攻击者可能通过提示注入影响分类。关键权限不能只由模型路由决定,应由独立的身份、规则和策略层再次验证。
OpenAI 的代理指南建议先用能力更强的模型建立质量基线,再尝试替换较小模型优化成本。这比一开始用弱模型更容易区分任务本身是否可行,以及质量下降发生在哪里。
计算每个成功任务的成本
单位成功成本 = 模型与基础设施费用 + 重试费用 + 人工复核与返工费用,再除以通过验收的任务数。假设小模型每次成本只有大模型的四分之一,但一次通过率从 95% 降到 75%,且失败需要人工处理,最终差距可能远小于四倍。
批量任务还要考虑利用率。自托管在稳定高吞吐时更容易摊薄设备成本,低流量则可能长期支付闲置容量。对端侧产品,应把包体、耗电和设备支持成本纳入总账。
建立每周路由看板:各模型接收多少任务、通过率、升级率、人工处理和成本,并按语言、客户和任务类型切分。当小模型升级率持续升高,问题可能来自输入分布变化,而不是简单需要调高阈值。
从一个任务开始建立路由
选择输出可校验的高频任务,先用强模型建立基线,再在相同数据上测试小模型。分析失败类型,建立升级规则,并进行一段时间影子运行。只有在质量、延迟和单位成功成本同时达标后,才扩大流量。
小模型真正改变产品的地方,是让过去因延迟、隐私或成本无法持续运行的能力变得可用。发布后仍需保留持续抽样审计、版本回滚和清晰明确的人工升级通道,防止输入分布变化把低成本变成持续累积且难以发现的隐性错误。它的优势来自经过评测的恰当分工,而不是参数规模本身。
参考资料
更新记录
首次发布,暂无后续更新。
DISCUSSION
评论 0
理性讨论,尊重不同观点。
登录后参与讨论。
登录注册账号还没有评论,欢迎留下第一个观点。