这两年 AI 已经从“陪你聊天”进化到“替你干活”了。
我理解的 AI Agent,不只是回答问题,而是能自己拆任务、查资料、读写文件、调用工具、执行命令,最后交付代码、文档、表格、PPT或者网页。
目前比较热门的几款,我简单盘一下。先声明:不恰饭、不引战,价格和额度经常变,所以不写死,主要聊体验和适用场景。
一、ChatGPT / Codex:综合能力比较全面
优点:
- 写代码、查资料、分析文件、做表格和文档都能覆盖
- Codex能直接理解代码仓库、修改文件、运行命令和测试
- CLI、IDE、网页等使用方式比较齐全
- 比较适合从需求分析一路做到可交付结果
缺点:
- 功能多,刚开始可能不知道应该用哪个入口
- 复杂任务依然需要把目标、限制和验收标准说清楚
- 自动执行不等于一定正确,代码和数据结果必须人工验收
适合:既写代码又做资料、方案、文档,想要“一站式”的人。
二、Claude Code:程序员味很浓
优点:
- 对大型代码库、跨文件修改和复杂逻辑分析比较友好
- 终端操作自然,能读代码、改代码、跑命令、处理 Git
- 支持规则、Skills、Hooks、MCP和多 Agent,定制空间大
- 做重构、排查 Bug、补测试这类工程任务很顺手
缺点:
- 核心优势集中在编程,普通办公用户未必能发挥出来
- 权限开得太大时,需要注意误改文件或执行高风险命令
- 长任务的消耗和成本需要关注
适合:天天泡在终端里、维护中大型项目的开发者。
三、Cursor Agent:编辑器内体验最顺手
优点:
- 和代码编辑器结合紧,查看上下文、修改代码、看 Diff很方便
- 能搜索代码库、编辑文件、运行终端,还能调用浏览器
- 支持选择不同模型,不必完全绑定一家模型
- 对习惯 VS Code 操作方式的人,上手成本较低
缺点:
- 本质上仍然围绕编程场景,通用办公不是主战场
- 效果既取决于 Cursor 的 Agent 调度,也取决于所选模型
- 大改动时仍要认真审查 Diff,不能一路无脑接受
适合:希望 AI 直接长在编辑器里的开发者。
四、Gemini CLI:开源、终端党友好
优点:
- 开源,可以直接在本地或 Cloud Shell 终端使用
- 支持文件操作、命令执行和 MCP
- 除了写代码,也能做研究、内容处理和任务管理
- Google生态用户接入相对自然
缺点:
- CLI 对普通用户不如网页产品直观
- 实际体验会受模型、地区、网络及额度影响
- 复杂工程任务的稳定性仍然取决于提示词和项目结构
适合:喜欢开源工具、终端工作流或者 Google Cloud 生态的人。
五、GitHub Copilot Agent:GitHub 工作流选手
优点:
- 能直接研究仓库、制定计划、修改分支并创建 PR
- 适合处理 Issue、补测试、更新文档和小型技术债
- 所有改动都进入 GitHub 流程,团队审查和追踪比较方便
- 可以在后台执行,不需要一直盯着 IDE
缺点:
- 离开 GitHub 仓库场景后,优势明显下降
- 更适合边界清楚的任务,复杂架构决策仍需要人来把关
- 会涉及 AI 用量以及 GitHub Actions 等资源消耗
适合:工作流程高度依赖 GitHub、想把 Agent 当“初级队友”的团队。
六、Manus:偏通用任务交付
优点:
- 浏览器和文件系统能力比较突出
- 做调研、PPT、表格、网页等任务,交付形态比较丰富
- 不要求用户会写代码,普通人用自然语言就能下任务
- 云端运行,适合交给它一个任务后过一会儿回来收结果
缺点:
- 多步骤任务耗时可能较长
- 研究报告和网页操作仍可能出现事实错误或步骤跑偏
- 涉及登录、支付、隐私数据时必须谨慎授权
- 对专业编程项目的深度,未必能替代专门的 Coding Agent
适合:运营、产品、学生以及需要快速做资料和成品的人。
七、Kimi Agent/国产 Agent:中文场景更接地气
优点:
- 中文需求理解和国内使用环境相对友好
- 能做网页、文档、表格、PPT、数据分析等综合任务
- 国内访问、付款和客服通常更方便
- 国产编程 Agent 在本地工程、终端和 MCP方面也越来越完整
缺点:
- 不同产品能力差异很大,不能因为都叫“Agent”就当成一类
- 新功能更新快,稳定性和长期维护还需要观察
- 专业任务同样存在幻觉、格式漂亮但内容不准的问题
适合:中文办公、国内网络环境,以及更看重使用便利的人。
我个人的结论:
如果主要写代码,优先比较 Codex、Claude Code、Cursor、Gemini CLI和 Copilot;如果主要做调研、PPT、表格、网页,ChatGPT、Manus、Kimi这类通用 Agent 更合适。
现在并不存在真正意义上的“全能第一”。选 Agent 更像选球员:有的适合持球大核,有的适合无球终结,有的擅长防守干脏活。关键不是跑分多高,而是能不能稳定完成你每天真正在做的任务。
最重要的一点:Agent 是执行者,不是责任人。代码合并、数据结论、账号权限、支付和对外发布,最终还得自己检查。
兄弟们实际用过哪款?别只看发布会和测评,欢迎说说真实体验:
- 哪款最省心?
- 哪款写代码最强?
- 哪款最容易半路跑偏?
- 你愿意每个月为 Agent 花多少钱?