模型选型与推理模型
模型是智能体的"大脑",选错模型往往让后面所有工程白费。本章先给模型分分类,再讲从哪些维度挑选,并解释"推理模型"适合什么、本地与 API 怎么权衡。
模型的基本分类
| 分类维度 | 类别 | 说明 |
|---|---|---|
| 按能力定位 | 通用对话模型 | 快、便宜,适合大多数日常任务 |
| 推理模型(reasoning) | 回答前先"长思考",数学/代码/规划更强,但更慢更贵 | |
| 按开放程度 | 闭源(厂商 API) | 如 OpenAI o 系列、DeepSeek R 系列等,能力最强处常在这 |
| 开源权重 | 可自托管、可微调,如各类开放权重模型 | |
| 按模态 | 单模态 | 只处理文本 |
| 多模态 | 还能看图/听音等 |
关键认识:推理模型通过"额外思考 token"换取难题上的准确率,代价是延迟与费用上升。简单任务用推理模型是浪费,复杂推理任务用普通模型又不够——两者搭配使用是常态。
选型要考虑的维度
| 维度 | 关注点 |
|---|---|
| 能力 | 指令遵循、工具调用、推理、长上下文表现 |
| 价格 | 输入/输出单价、缓存优惠、批量折扣 |
| 延迟 | 首 token 与整体响应速度 |
| 数据合规 | 数据能否出境、是否允许第三方处理 |
| 生态 | API 兼容性、框架支持、供应商稳定性 |
# 选型常做成配置,方便随时切换模型
MODEL = "deepseek-chat" # 教程统一示例;生产按场景换
本地 vs API 怎么选
| 方案 | 优点 | 代价 |
|---|---|---|
| 云端 API | 免运维、能力强、起步快 | 数据出境、按量付费、供应商绑定 |
| 本地部署 | 数据不出内网、可控、可离线 | 需 GPU 硬件、模型能力偏弱、要运维 |
无敏感数据、要最强能力、团队小 → 优先 API;有合规要求或数据敏感 → 本地或私有化部署(详见本地模型章节)。
怎么验证"够不够用"
榜单与宣传只能当线索,最终要以自己的任务实测为准。选型期常做一个"迷你验证集":拿 10~20 个典型问题(含刁钻案例),让候选模型各自跑一遍,人工对比输出与成本:
# 伪代码:同一任务、不同模型跑分对比
for model in ["deepseek-chat", "candidate-a", "candidate-b"]:
cost, answers = run_task_battery(model, cases) # 同一批用例
print(model, summarize(answers), cost)
# 输出:deepseek-chat 准确率0.82 成本低(作为基线)
指标接近时优先便宜、快、文档全的那个;指标差距明显且业务不可妥协,再为关键路径接受更贵模型。
教程示例约定
模型迭代极快,"某某是最新版/最强"的说法很快过期。本教程统一以 deepseek-chat 等稳定模型作示例——它代表"主流 API 的常规用法",写法与模型解耦。真实项目应把模型名做成配置并依据实测替换,不必迷信宣传。
小结
先分清通用对话与推理模型、开源与闭源、单模态与多模态;再按能力、价格、延迟、合规、生态五维打分。没有敏感诉求用 API,有合规约束走本地;教程示例固定为 deepseek-chat 等稳定模型,学习重在通用机制而非追新。