引言
随着代码智能体(Coding Agent)快速落地,Harness 已经不再是小众概念。很多开发者在选型时,容易混淆模型能力、API服务和Harness框架,简单用“模型强弱”来评判整套智能体系统,最终上线后才发现权限管控、工具调用、执行循环、沙箱隔离等环节出现大量问题。
本文基于LangChain在2026年9月发布的官方分类体系,对30款主流Coding Agent Harness、SDK与Runtime进行全景梳理。Harness可以理解为一套“预装电池的框架”,内置提示词、子Agent调度、工具调用能力;而SDK、Runtime更多负责上下文持久化、文件读写、Shell执行、循环校验与日志治理。选型的核心原则:先选定Harness类型,再挑选具体产品,不存在一款能够适配所有场景的万能方案。
本文所有产品能力、迁移状态信息,以2026年9月15日可访问的官方文档、代码仓库为准,不做静态排名,仅做场景化对比。
1. 理解Harness:智能体的执行骨架
大模型负责生成下一步动作,而Harness决定模型能够看到哪些信息、可以调用哪些工具、任务如何持续推进,以及交付结果的验收标准。一套完整的Coding Agent Harness,包含8个核心层级:
- 模型适配层:负责认证、模型选择、流式输出、重试策略与上下文窗口管理。
- 工具层:封装Shell命令、文件读写、代码检索、MCP协议、会话恢复、Git操作等基础能力。
- 提示词层:包含系统指令、任务模板、输出格式约束。
- 权限层:审批流、沙箱环境、网络访问、目录范围、敏感操作拦截策略。
- 执行循环:规划、行动、观察、纠错、终止条件与预算管控。
- 验证层:单元测试、lint、代码差异比对、任务结果汇总。
- 协作层:子Agent调度、后台任务队列、多任务并行处理。
- 交互层:CLI终端、IDE插件、桌面客户端、Web页面与API接口。
Anthropic官方文档将 Claude Code 定义为可读取代码库、编辑文件、执行命令并对接开发工具的编码智能体;OpenAI把Codex CLI定位为终端环境调用Codex能力的入口。二者底层模型不同,但Harness需要解决的核心问题一致:组织上下文,串联工具,在可控环境下完成编码任务。
2. 选型前澄清三大认知误区
很多选型失败,根源是概念混淆,需要提前理清三个核心误区:
误区1:模型越强,Harness就一定强
同一个大模型,接入不同Harness,表现会存在明显差异。
Harness的系统提示词、上下文检索策略、工具Schema定义、审批策略、错误反馈、验证循环,都会直接影响最终效果。做真实性能测评,必须固定模型、代码仓库、任务集、权限边界与预算,否则对比结果没有参考价值。
误区2:支持多模型,就等于低成本替换模型
支持多模型仅代表入口兼容。更换模型会改变工具调用格式、推理成本、上下文长度上限、图像输入支持、缓存策略与报错信息。选型表中的“多模型支持”只是基础准入条件,不能直接等同于无缝迁移,切换后仍需要大量回归测试。
误区3:能自动修改代码,等同于可以自主交付
文件编辑仅仅是整个任务循环里的一个步骤。自主交付还包含环境初始化、依赖安装、单元测试、失败回滚、Git版本操作、权限控制、结果汇总与人工接管机制,缺一不可。
3. 30款Harness、框架全景对比总览
本次统计的30个方案分为五大形态:成品终端Agent、IDE开发环境Agent、自治软件工程平台、自建Harness SDK、Agent框架与Runtime。横向对比必须在同类型产品内筛选;表格内“模型策略”仅描述适配倾向,不代表模型能力完全等价。
| 类别 | 方案 | 主要入口 | 模型策略 | 核心选型指标 |
|---|---|---|---|---|
| 成品终端Agent | Claude Code | CLI、IDE、桌面、Web | Claude为核心,可接入第三方模型服务商 | 多入口一致性、CLAUDE.md、钩子、技能包、MCP、沙箱、人工审批 |
| 成品终端Agent | Codex | CLI、IDE、桌面、云端 | OpenAI模型为核心 | AGENTS.md、任务编排、技能包、MCP、并行任务、代码审查 |
| 成品终端Agent | Gemini CLI | CLI | Gemini为核心 | 开源CLI、终端工作流、MCP扩展、Google生态、Agent能力 |
| 开放终端Agent | OpenCode | TUI、CLI、桌面、IDE、Web | 多模型服务商 | 开源、服务商配置、Agent权限、LSP、MCP、SDK、插件系统 |
| 开放终端Agent | Qwen Code | CLI、IDE集成、SDK | 通义千问,兼容多种API协议 | 开源、技能包、子Agent、无头模式、开发者SDK |
| 开放终端Agent | Aider | CLI | 多模型服务商 | Git原生、轻量结对编程、仓库映射、低界面负担 |
| 开放通用Agent | Goose | CLI、桌面、API | 多模型服务商 | 本地运行、MCP/ACP、Recipe、子Agent、安全管控 |
| 托管本地Agent | Amp | Web、CLI、macOS、iOS | 平台多模型路由 | 本地线程与云端Orb、跨设备任务、后台执行 |
| 插件化运行时 | DeepSeek Harness | Web UI、CLI | 可配置模型插件 | Cordis插件体系、会话追踪、四种运行模式、开发者预览版 |
| AI开发环境 | Cursor | IDE、CLI、Web/移动端、Cloud Agent | 平台模型目录 | 编辑长上下文、Agent规则、技能包、MCP |
| AI开发环境 | Kiro | IDE、CLI、Web、Mobile | 平台模型目录 | 统一Harness规范、Spec文档、钩子、技能包、MCP |
| 多入口开放Agent | Cline | IDE、CLI、桌面、TUI、看板、SDK | 多模型服务商 | 人工审批、工具轨迹、MCP、规则、技能包、子Agent、并行任务 |
| IDE Agent平台 | Continue | VS Code、JetBrains、CLI | 多模型服务商 | 开源扩展、Agent/聊天/编辑/自动补全、共享配置 |
| AI编辑器 | Zed Agent | Zed面板、ACP外部 | 自带与外部模型服务商 | 多线程、worktree隔离、检查点、diff审查 |
| 多入口编码Agent | JetBrains Junie | JetBrains IDE、CLI、CI/CD | 平台与BYOK | 并行worktree、Headless、ACP、GitHub Action、GitLab CI/CD |
| 异步编码Agent | GitHub Copilot cloud agent | GitHub、Issue、PR、集成入口 | Copilot模型体系 | 独立临时环境、后台任务、分支管理、可审批PR、仓库治理 |
| 自治软件工程平台 | OpenHands | Web、本地、云、API | 多模型服务商 | 开源平台、沙箱运行、Issue/仓库任务、可部署性 |
| 自治软件工程平台 | Devin | Web、CLI、桌面、API | 平台托管 | 本地到云端handoff、异步长任务、独立工作区、团队交付 |
| 异步编码Agent | Jules | Web、GitHub、虚拟机 | Google托管 | 计划审批、后台执行、仓库任务、AGENTS.md |
| 应用构建Agent | Replit Agent | Web、Replit工作区 | 平台路由 | 需求到部署、计划模式、检查点、托管运行环境 |
| 研究最小Agent | mini-SWE-agent | CLI、批量评测 | 多模型服务商 | Bash-only、线性轨迹、沙箱适配、基准研究 |
| 自建SDK | Claude Agent SDK | Python、TypeScript SDK | Claude为核心 | 复用Claude Code的Agent循环、工具调用能力 |
| 自建Harness SDK | LangChain Deep Agents | Python、JavaScript | 多模型服务商 | 文件系统、规划、上下文管理、技能包、子Agent |
| 自建Harness SDK | Pydantic AI Harness | Python/TypeScript | 多模型服务商 | 类型安全、能力组合、Shell接入、规划、压缩、子Agent |
| 自建Harness SDK | Microsoft Agent Framework Harness Agent | Python、.NET、Go | 多模型服务商 | 规划、压缩、文件与记忆、工具审批、可观测性 |
| 邻接Agent框架 | OpenAI Agents SDK | Python、TypeScript SDK | OpenAI原生并可扩展 | 工具、任务交接、防护、会话追踪、沙箱Agent |
| 邻接Agent框架 | Google ADK | Python、TypeScript、Go、Java、JavaScript | 多模型服务商 | 多Agent、图工作流、上下文管理、评测部署 |
| Agent Runtime | LangGraph | Python、JavaScript库 | 模型无关 | 持久化、人工介入、流式执行、故障恢复 |
| 迁移项 | AutoGen | Python、.NET | 模型可配置 | 官方推荐Microsoft Agent Framework作为直接后继 |
| 迁移项 | Roo Code | VS Code扩展 | 多模型服务商 | 官方文档扩展已停止,社区分支继续维护 |
| 迁移项 | Windsurf | 独立编辑器 | 平台模型目录 | 官方入口转为Cline Desktop与Devin,产品线迭代 |
> 表格解读提示:成品Agent上手门槛低,自带完整工具集和上下文管理;Harness SDK适合深度定制;Framework与Runtime,需要开发团队自行补齐大量组件。
4. 终端型Harness选型要点:面向仓库、命令行与Git的开发者
终端类Harness适合以代码仓库、命令、Git为核心工作流的开发人员,选型差异集中在模型绑定、权限控制、开放程度。
Claude Code
Anthropic在2026年9月发布的版本支持CLI、VS Code、桌面端、Web、JetBrains五种入口,多入口共享同一套底层配置。适合已经使用Claude生态,需要Hooks、技能包、MCP、并行Agent、CI/CD持续任务的团队。测评重点关注第三方服务商兼容性、权限策略、钩子稳定性与会话成本。
Codex
Codex CLI是OpenAI官方的终端脚本入口,同时覆盖IDE、桌面、云端任务与代码审查。项目规则通过AGENTS.md分组管理,支持文件写入、命令审批、变更审查、并行任务。适合重视代码文件、命令审计、变更审查,并且深度使用OpenAI Agent生态的团队。测试重点:本地与云端任务环境差异、网络权限、AGENTS.md生效逻辑。
Gemini CLI
Google生态的开源终端Agent入口,将Gemini模型能力带到终端。适合已经使用Gemini、Google Cloud,或者需要自研CLI代理的团队。验证重点:目标模型地区可用性、扩展权限、MCP兼容、企业认证方式。
OpenCode
OpenCode是完全开源的AI编码代理,支持TUI/CLI/桌面/IDE多形态,支持自定义服务商、LSP、MCP、技能包、插件系统。适合需要切换模型服务商,希望掌握配置、服务、权限,同时保留多端使用能力的团队。
Qwen Code
面向编程场景的开源AI Agent,内置技能包、子Agent、无头模式、IDE集成与开发者SDK,兼容OpenAI、Anthropic、Gemini协议。适合需要国产化模型、协议兼容、随时切换服务商的个人或团队。
Aider
轻量级、Git原生的结对编程工具。它不以全能Agent为卖点,核心优势是简洁Harness、Git变更同步、保留提交节奏,非常适合个人和小型团队,追求清晰diff、可控交互。
Goose & Amp
Goose为本地通用Agent,支持桌面、CLI、API,内置MCP、Recipe、子Agent。Amp同时提供本地CLI与云端Orb,支持macOS、iOS跨设备任务。适合需要本地快速交互,同时把繁重任务交给云端执行的用户。
DeepSeek Harness
属于插件化运行时,官方在2026年8月发布版本,提供模型、工具、技能、会话、沙箱、存储、调度、UI八大插件能力,包含Standard、Code、Minimal、Creator四种运行模式。该产品定位开发者预览版,存在兼容性风险,生产环境使用需要增加测试与回滚方案。
5. IDE与一体化开发环境Harness
IDE型Harness最大优势是上下文天然和代码、选区、诊断信息绑定;代价是平台耦合更强。
Cursor与Kiro
Cursor将Agent、规则、技能包、MCP、工具调用、会话管理整合进产品体系;Kiro支持IDE、CLI、Web、移动端,使用统一Harness规范。适合愿意把代码开发迁移进AI开发环境,需要平台管理任务、后台任务、团队协作的团队。
Cline
从VS Code插件扩展为全入口Agent,覆盖VS Code、JetBrains、CLI、TUI、看板,保留逐步人工审批、浏览终端、MCP、技能包、子Agent。适合需要切换服务商、人工审核,编辑器和终端共用同一套Agent内核的团队。
Continue
可组装的开发者AI平台,集成Agent对话、代码编辑、自动补全。适合团队统一规则、文档、共享配置。
Zed Agent与JetBrains Junie
Zed Agent主打多线程、worktree隔离、检查点、代码diff审查;Junie深度对接JetBrains全家桶,支持CI/CD、ACP、GitHub Action。选型建议:已经在使用Zed或JetBrains的团队优先评估,不要只看Agent能力单独更换整套开发工具。
6. 自治型Harness:适合交付端到端软件工程任务
自治平台的核心是把任务从“对话”变成计划、执行、交付、审查闭环,必须重点评估隔离能力与失败恢复机制。
GitHub Copilot cloud agent依托GitHub Action,在临时环境读取仓库、生成分支、提交PR,可以直接从Issue接收需求。适合代码、评审、权限全部托管在GitHub上的团队。
OpenHands开源软件工程Agent,支持本地、云端部署,适合希望自主控制运行环境、模型服务商、自动化集成的团队。
Devin是托管自治工程产品,Web、CLI、桌面、API多入口。CLI处理本地任务,复杂任务可移交云端Devin执行,提供独立工作区,适合长周期大型项目交付。
Jules与Replit Agent:Jules依托GitHub虚拟机执行任务;Replit Agent在Replit托管工作区运行,从需求到部署全链路托管。
mini-SWE-agent属于研究向最小基线Agent,仅支持Bash指令,多用于学术基准测试,不适合作为日常IDE助手。
7. 自建Harness:区分SDK、Framework、Runtime
当Agent需要嵌入自研产品、对接内部权限系统与业务逻辑时,应当评估SDK方案,而不是继续使用成品客户端。
Claude Agent SDK可以复用Claude Code的Agent循环、工具调用逻辑,在Python、TypeScript应用内自定义工具与权限。
LangChain Deep Agents基于LangGraph,可组合规划、文件管理、技能包、子Agent、人工介入。
Pydantic AI Harness依托Python类型系统,组合能力包,提供Shell、仓库上下文、规划、压缩与子Agent能力。
Microsoft Agent Framework Harness Agent提供规划、记忆、文件管理、工具审批、可观测性模块。
OpenAI Agents SDK、Google ADK更偏向Agent框架,内置工具交接、沙箱、多Agent编排,需要自行搭建文件系统、项目规则。
LangGraph属于底层Runtime,主打持久化、流式执行、人工介入、故障恢复。
AutoGen已经停止主版本迭代,官方推荐迁移至Microsoft Agent Framework;Roo Code、Windsurf也进入产品迭代或维护阶段,选型时注意迁移风险。
在多模型接入场景,团队可以借助Treerouter这款API中转站统一管理不同模型端点的路由、鉴权与流量管控,简化多Harness对接不同服务商的配置成本。
> 自建方案优势是高度可控;缺点是团队必须自行负责安全、存储、追踪、评测、升级维护。没有专职平台团队的情况下,成品Agent往往上线更快。
8. 12维度标准化评测方法
选型不能只看Demo演示,必须固定仓库、任务集、环境变量,在同等条件下做横向评测,一共12个核心评估维度:
- 入口:CLI、IDE、桌面、Web;操作链路、学习成本。
- 模型:服务商兼容性、上下文窗口、token成本、推理延迟。
- 上下文:项目检索、摘要、压缩、记忆、会话恢复能力。
- 工具:Shell、文件读写、MCP、自定义工具结构化输出。
- 权限:目录、命令、网络、环境变量的访问管控策略。
- 限流:token用量、速率、工具调用次数与预算限制。
- 协作:子Agent、后台任务、队列、并行任务冲突处理。
- 验证:单元测试、diff、PR、人工审批、终止条件。
- 可观测:日志查看、MCP调用记录、token消耗、任务状态。
- 治理:规则、技能包、MCP、告警、审计日志导出。
- 可移植:跨机器、跨服务商、多仓库兼容。
- 总成本:模型费用、算力、人力维护、人工接管工时总和。
9. 标准化测试任务集
一套完整Harness测评,至少覆盖读取、修改、测试、查询、协作、恢复六大任务类型。
- 任务A:仓库理解:查找代码定义、定位依赖,禁止修改代码;统计耗时、错误数量、引用准确率。
- 任务B:跨文件小改动:一次性修改多处代码,记录改动文件、diff、人工干预次数、token消耗。
- 任务C:失败修复:构造稳定复现bug,观察Harness捕获报错、缩小范围、修复并验证。
- 任务D:权限边界校验:验证Agent是否遵守网络、文件访问白名单,验证越权拦截。
- 任务E:并行任务:多任务并发,检查上下文隔离、结果汇总、重复工作。
- 任务F:中断恢复:网络中断或进程重启,验证会话完整性、断点续执行、人工接管成本。
10. 场景化选型推荐
- 终端仓库开发:优先 Claude Code、Codex、OpenCode;国产化需求选Qwen Code;重度Git工作流选择Aider。
- IDE内编码:Cursor、Kiro、Cline、Continue;JetBrains用户选择Junie;Zed编辑器用户评估Zed Agent。
- GitHub原生流水线:GitHub Copilot cloud agent、OpenHands、Jules。
- 产品内嵌Agent:Claude Agent SDK、Deep Agents、Pydantic AI Harness、Microsoft Agent Framework。
- 自研框架/工作流:OpenAI Agents SDK、Google ADK、LangGraph。
11. 上线前硬性红线
任何Harness进入生产环境前,必须确认以下约束,不能只看Demo成功运行:
- 不允许在生产环境开启无限制文件写入、Shell执行。
- 不允许开放无管控的网络访问。
- 不允许未经审查的MCP、技能包、插件直接加载到生产配置。
- 必须配置token、调用次数、时长上限,设置预算熔断。
- 所有操作必须留存审计日志,用于事后追溯。
结语
Coding Agent Harness的选型,本质不是比拼单一模型能力,而是评估整套系统的上下文管理、工具调度、权限隔离、验证循环、可观测性与维护成本。30款工具各有侧重:成品Agent适合快速落地;IDE型Harness适合日常编码;自治平台适合端到端软件工程交付;SDK和Runtime适合深度嵌入自有业务系统。
选型团队应当先明确工作入口、权限边界、交付方式,再从同类别产品中筛选,使用标准化任务集做实测,避免仅凭宣传Demo做决策。所有产品的能力、迁移状态、价格,以官方页面最新版本为准。
了解更多:https://treerouter.com






