面向 Agent 的大模型能力
Agent 把大模型当作「决策大脑」,因此真正关心的是:模型能否被可靠地指挥、可靠地输出。本章梳理 2025 年前后主流大模型为 Agent 提供的几类关键能力,并诚实说明各自的边界。
对话补全
所有大模型都提供最基础的对话补全:输入一段 messages 历史,输出续写的文本。Agent 的推理、总结、写代码,底层都是反复调用这个接口。它是其他一切能力的底座。
函数调用
2023 年起各家模型陆续支持函数调用(Function Calling / Tool Use):开发者用 JSON 描述一批工具,模型在需要时返回「该调用哪个工具、参数是什么」,由程序真正执行,再把结果交回模型继续推理。这是 Agent 能「动手」的关键,工具描述格式以所用模型文档为准。例如描述一个天气工具:
{
"name": "get_weather",
"description": "查询城市天气",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
模型本身不会真的去请求天气,它只输出「调用 get_weather、参数 city=北京」这样的请求,真正发请求的是你的程序,这一来一回构成工具调用。
长上下文
模型一次能处理的输入规模叫上下文窗口。2024-2025 年主流模型普遍支持 128K 以上 token,部分达到百万级,Agent 因此可以把整份代码库、整本文档放进一次对话。窗口大小、超长时的计费与降速策略随模型版本变化,以官方文档为准。
结构化输出
Agent 的程序逻辑需要的是可靠数据,而不是散文。多数模型支持用 JSON Schema 或 json 模式约束输出,保证返回可解析的 JSON,让代码可以直接拿字段做分支判断(详见第 09 章)。
推理模型
2024 年底起出现专门的推理模型(如 OpenAI 的 o 系列、DeepSeek-R1 等推理版本):它们在给出答案前先产生一段内部思考(reasoning),在数学、代码、复杂规划上显著更准,代价是更慢、更贵。选型原则是:任务越难越值得用;字段与用法以官方文档为准。
多模态
主流模型已普遍支持图片输入,部分支持音频与视频。对 Agent 的意义在于能「看」截图、表格和界面再行动。各家的模态范围、输入格式与计费差异很大,以官方文档为准。
能力组合:谁在撑起 Agent
现实中的 Agent 几乎不会只用一种能力:系统提示词定义行为靠对话补全,要不要查资料靠函数调用,长文档先检索再放进上下文靠长窗口,结果按 Schema 回传靠结构化输出,难题先想再答靠推理。这张能力清单就是本系列后续章节的地图。
能力边界:诚实地看待模型
模型并非全知全能,Agent 开发要认清几条常见边界,并用工程手段补齐:
| 边界 | 表现 | 应对 |
|---|---|---|
| 幻觉 | 一本正经地编造事实 | 用工具查证、要求给出来源 |
| 知识截止 | 不知道训练之后的事 | 接搜索或 RAG |
| 计算不稳 | 复杂运算易出错 | 交给计算器、代码工具 |
| 长任务漂移 | 步骤多了忘记目标 | 定期反思、校验中间结果 |
| 上下文有限 | 内容太长记不住 | 压缩、检索、分块 |
| 价格与限流 | 长文本、高并发成本高 | 缓存、批处理、量力选档 |
| 知识冲突 | 上下文自相矛盾时摇摆 | 明确优先级、先做去重 |
小结
面向 Agent 的模型能力可归纳为:会对话、会调用函数、吃得下长文本、输出守规矩,必要时先思考,还能读多模态输入。但幻觉、知识截止等边界始终存在,要用工具与工程手段补齐,而不是指望模型变得万能。