模型选型与推理模型

模型是智能体的"大脑",选错模型往往让后面所有工程白费。本章先给模型分分类,再讲从哪些维度挑选,并解释"推理模型"适合什么、本地与 API 怎么权衡。

模型的基本分类

分类维度类别说明
按能力定位通用对话模型快、便宜,适合大多数日常任务
推理模型(reasoning)回答前先"长思考",数学/代码/规划更强,但更慢更贵
按开放程度闭源(厂商 API)如 OpenAI o 系列、DeepSeek R 系列等,能力最强处常在这
开源权重可自托管、可微调,如各类开放权重模型
按模态单模态只处理文本
多模态还能看图/听音等

关键认识:推理模型通过"额外思考 token"换取难题上的准确率,代价是延迟与费用上升。简单任务用推理模型是浪费,复杂推理任务用普通模型又不够——两者搭配使用是常态。

选型要考虑的维度

维度关注点
能力指令遵循、工具调用、推理、长上下文表现
价格输入/输出单价、缓存优惠、批量折扣
延迟首 token 与整体响应速度
数据合规数据能否出境、是否允许第三方处理
生态API 兼容性、框架支持、供应商稳定性
# 选型常做成配置,方便随时切换模型
MODEL = "deepseek-chat"          # 教程统一示例;生产按场景换

本地 vs API 怎么选

方案优点代价
云端 API免运维、能力强、起步快数据出境、按量付费、供应商绑定
本地部署数据不出内网、可控、可离线需 GPU 硬件、模型能力偏弱、要运维

无敏感数据、要最强能力、团队小 → 优先 API;有合规要求或数据敏感 → 本地或私有化部署(详见本地模型章节)。

怎么验证"够不够用"

榜单与宣传只能当线索,最终要以自己的任务实测为准。选型期常做一个"迷你验证集":拿 10~20 个典型问题(含刁钻案例),让候选模型各自跑一遍,人工对比输出与成本:

# 伪代码:同一任务、不同模型跑分对比
for model in ["deepseek-chat", "candidate-a", "candidate-b"]:
    cost, answers = run_task_battery(model, cases)   # 同一批用例
    print(model, summarize(answers), cost)
    # 输出:deepseek-chat 准确率0.82 成本低(作为基线)

指标接近时优先便宜、快、文档全的那个;指标差距明显且业务不可妥协,再为关键路径接受更贵模型。

教程示例约定

模型迭代极快,"某某是最新版/最强"的说法很快过期。本教程统一以 deepseek-chat 等稳定模型作示例——它代表"主流 API 的常规用法",写法与模型解耦。真实项目应把模型名做成配置并依据实测替换,不必迷信宣传。

小结

先分清通用对话与推理模型、开源与闭源、单模态与多模态;再按能力、价格、延迟、合规、生态五维打分。没有敏感诉求用 API,有合规约束走本地;教程示例固定为 deepseek-chat 等稳定模型,学习重在通用机制而非追新。

笔记加载中…