从聊天机器人到 Agent
普通聊天机器人最擅长的是:根据输入文字生成一段回答。Agent 则多了一层“行动能力”:它可以查看环境、调用工具、根据结果调整下一步,并持续工作到形成可检查的结果。
一个简单对比
你问普通聊天机器人“这个项目为什么启动失败”,它只能根据你贴出的信息推测。你把同一问题交给项目中的 Agent,它可以在权限允许时:
- 查看依赖和启动配置;
- 搜索相关代码;
- 运行一个诊断命令;
- 读取命令结果;
- 修改文件或提出修复建议;
- 运行测试并报告证据。
这并不意味着 Agent 天然更正确。它只是拥有更多获取证据和影响环境的途径,因此也需要更严格的权限与核对。
Agent 的四个组成部分
模型
模型负责理解目标、选择下一步和生成文字。模型不是数据库,也不会自动知道你电脑中的文件或今天的网页内容。
上下文
上下文是当前模型请求能够看到的信息,包括任务说明、对话历史摘要、相关文件结果、工具说明等。上下文有容量上限,因此系统需要选择、计量和压缩。
工具
工具让模型能够读取文件、搜索代码、运行命令、联网检索或调用 MCP Server。模型只是在提出调用;Host 仍会校验参数、权限和审批。
循环
Agent 通常不是一次请求就结束。模型调用工具、观察结果、再决定下一步,直到给出最终回答、等待审批、失败或被取消。这就是 Agent Loop。
“会行动”不等于“可以全权托管”
Agent 可能误解任务、选择错误工具、受到网页或项目中不可信文字的影响,也可能在外部调用超时后无法判断动作是否成功。安全使用需要三层配合:
- 你写清目标、边界和完成条件;
- 系统执行权限、审批、路径和参数检查;
- 你用文件、测试、来源和外部状态验证结果。
因此,最成熟的用法不是把所有控制都交给 Agent,而是把它当成能持续调查和执行的协作者。
在 Captain Who 中的对应关系
- 一个项目提供本地工作区范围;
- 一个对话保存你与根 Agent 的长期交流;
- 一次发送通常启动一个 Run;
- Run 内可能经过多轮模型与 Tool 交换;
- 需要人决定时,Run 可以暂停为等待审批;
- Multi-Agent 让根 Agent 把独立任务交给子 Agent;
- Scheduled Automation 让一个根 Agent Run 按计划触发。
这些名词可以在术语表中随时查询。