Перейти к содержимому

Ollama 决策模型实测:90 毫秒做出带概率分布的可靠判断

AI每日推荐

0:00 / 0:00

Ollama 决策模型实测:90 毫秒做出带概率分布的可靠判断

21 просмотр · 2 дн. назад
AI每日推荐
135 подписчиков
21 просмотр · 2 дн. назад
Ollama 在 0.35 版本里加了一类新模型:决策模型(decision models),遵循 TypeSafe 的 Jev 接口规范。核心差别就一句话——它不生成文本,只从你给定的答案里选一个,并附带完整概率分布。 为什么需要它 用通用大模型做一次「是/否」判断看起来很轻,实际很贵:走远程 API 要计费加网络往返,而这类判断恰恰是高频、大量、单次价值极低的调用形态。更麻烦的是通用模型要先想再答,一次简单判断可能烧掉几百个 token,产出的那段文字程序根本用不上。Nimble 9B 在 M5 Max 上平均 91 毫秒一次决策,output_tokens 只有 1 到 4——因为它没有推理步骤,直接对答案 token 打分。 三种问题类型 choice:从 2 到 26 个选项里挑一个,返回最可能的选项和每个选项的概率 noul:返回一个 0 到 1 的真值概率,criteria 可选 score:在 2 到 26 级有序量表上定位,score 是概率加权平均 这三种类型可以在同一个请求里混用——一次工单请求就同时完成分派、判定、定级。 实战场景 工单分诊:一次请求同时拿到团队归属(choice,0.985)、是否退款(noul,0.997)、紧急度(score,0.815) 模型路由:用 choice 决定 prompt 该给哪个模型 工具审核:用 noul 判断 rm -rf 这类命令是否会造成伤害(0.996,138 毫秒) benchmark 说了什么 13 个公开数据集、3880 个人工标注决策,宏平均 Nimble 9B 是 74.8%,Jev 1.13 是 76.0%,差距不到 1.5 个点。但按类型拆开看结论完全不同:Nimble 在 Score 类反超(54.6% vs 50.1%),Boolean 类则是 Jev 明显领先(80.2% vs 84.6%)。Score 类绝对值低是口径问题——它要求最高等级完全匹配才计对。 上生产前的六条约束 1. 只能在给出的答案里选,不会写解释、嵌套 JSON 或引用原文 2. 问题之间独立打分,两个结论要一致必须自己在代码里校验 3. prompt 必须塞进 8192 token,越短测得越准 4. 0.9 的概率不等于 90% 正确率,阈值必须在自己数据上测 5. 没有匹配项时要加 no match 兜底选项 6. 决策模型还没进 Ollama CLI 和官方 Python/JS 库 一句话结论 本地跑、零费用、可复现,这才是决策模型的真正价值。Boolean 类(80.2%)可以放心用于审核拦截,Score 类(54.6%)建议只做粗分档并配合人工复核。 本视频 16 页完整讲解,代码与实测数据全部来自 Ollama 官方文档与 API 参考。 资料来源: https://ollama.com/blog/ollama-now-su... https://docs.ollama.com/capabilities/... https://docs.ollama.com/api/systemone https://ollama.com/library/nimble