上下文不再是 messages
成熟实现会维护调用/结果配对、真实 token 预算、摘要保尾、工具结果瘦身、checkpoint、world state,甚至把活动后台任务重新注入压缩后的会话。
不是产品功能清单,而是从主循环、上下文、工具、沙箱、MCP、指令、插件、子 Agent、持久化与观测一路钻进实现后的工程比较。
18 份源码显示,Coding Agent 的竞争已经从“会不会调用 shell”转向五个控制面:稳定上下文、可证明的权限边界、持久任务状态、可组合扩展、受治理的多 Agent。模型只是推理内核;Harness 决定它能否可靠交付。
成熟实现会维护调用/结果配对、真实 token 预算、摘要保尾、工具结果瘦身、checkpoint、world state,甚至把活动后台任务重新注入压缩后的会话。
Aider、OpenCode、Pi、Kimi 等可以有规则或询问,但默认仍在宿主执行;Codex/Open Interpreter、Gemini 可选沙箱、Grok、MonkeyCode 的隔离边界完全不同。
先进实现把模型可见 schema、隐藏兼容 handler、权限判定、并发 admission 和观测分开;Open Interpreter 更把多套 Harness 工具名翻译到统一 runtime。
真正的子 Agent 需要独立上下文、持久身份、深度/并发/预算限制、消息协议、取消、恢复和 artifact;只做一次双模型串行不等于控制面。
JSONL rollout/journal、tree session、checkpoint 与 shadow Git 是高频答案。数据库适合查询,事件账本更适合重建“当时究竟发生了什么”。
MCP、Skills、Plugins、Hooks、Extensions 能力越强,越需要来源、预算、签名、secret scope、输出限额、SSRF 和 fail-closed 的治理。
横向滚动查看。每个单元格是源码结论的压缩摘要;点击 Agent 名进入带代码摘录的完整报告。
| Agent / 类型 | 主循环 | 上下文 | 安全与沙箱 | 工具执行 | MCP / 扩展 | 子 Agent | 持久化 / 观测 |
|---|---|---|---|---|---|---|---|
| GooseRust · MCP-first 通用 Agent | 单一流式循环;完整 tool call 后并发;防失控上限 | 80% 结构化压缩;超窗逐级剥离工具结果 | 无强制工作区边界;Auto / Approve / SmartApprove | 同一模型 turn 多工具检查后并发 | MCP + Skills + Hooks 都很完整 | 独立子 Agent + 子会话 | SQLite/WAL + cost + tracing |
| AiderPython · Git-native Pair Programmer | 交互外环 + 有界 reflection;固定 lint/test/commit 交付链 | ChatChunks + 符号图 PageRank Repo Map + 二分 token 预算 | 宿主 shell;聊天文件集是主要写边界 | 编辑协议家族;dry-run → 授权 → 落盘 | LiteLLM 广,但没有核心 MCP/函数工具循环 | Architect → Editor 顺序双模型 | Git 事务、本地历史、LLM 原始日志、成本 |
| Grok BuildRust · Actor + Secure Worktree Agent | 长期 SessionActor;prepare → parallel dispatch → post-flight | 预热、两阶段压缩、任务状态重建与恢复梯子 | 真实内核文件系统/网络隔离;不支持或失败可降级 | 参数恢复层;PreToolUse 可在权限前阻断 | Plugin 同包 Skills/Commands/Agents/Hooks/MCP/LSP | 后台、恢复、限深与 worktree 子 Agent | 工具/权限/压缩/沙箱结构化事件 |
| Open InterpreterRust · Multi-Harness Compatibility Layer | Codex turn/step 快照循环;Harness 前后置整形 | 调用配对、多模态裁剪、Harness-aware compact | 审批与权限 profile 双轴;三平台原生沙箱 | Visible spec / dispatch registry 分离;大规模 aliases | MCP/Apps/Plugins/Skills/Hooks 共用 step snapshot | 共享 AgentControl 线程树;Harness Agent/Task alias | FileChange lifecycle + rollout/SQLite/trace + 独立 analytics |
| Little CoderTypeScript · Local-model Pi Extension | Pi 内核 + 动态知识尾部注入 + 80% watchdog | 大 Read 压到 30 行;知识按失败/近期工具/意图排序 | 宿主 bash;shell 分段白名单与重定向检测 | 禁止整文件覆写;Edit 强制先 Read | 默认固定扩展;Pi 生态桥显式 opt-in | 独立进程子 Agent;Plan/Research 多波次 | 结构化证据、质量 steer、best-effort checkpoint |
| MonkeyCodeGo/TS · Remote Agent Control Plane | DB 预登记 → VM → Redis 交接 → 选定 CLI | 只知道窗口上限;压缩和 memory 交给内层 Agent | 外层 VM 是主边界;内层 Codex sandbox 显式关闭 | MCP 有效集、幂等 replay、状态审计 | Rules/Skills/Plugins 分轨;global/team/user 覆盖 | owner write gate + 历史回放 + 实时流;无平台子 Agent | 协议流旁路用量归因 + OTLP allowlist |
| OpenCodeTypeScript · Persistent Session Platform | 持久化消息状态驱动;每 step 重建 agent/tools/system | 可用输入窗阈值;摘要保尾;工具输出后台 prune | 默认 ask 权限,但 shell 直接宿主执行 | Bash/PowerShell AST 扫描;Edit diff→权限→格式化→LSP | AI SDK providers + MCP OAuth/prompts/resources + 高权限 plugins | 独立持久子 session;前后台、限深、递归取消 | Session DB + shadow Git patch/revert + 显式 share |
| Oh My PiTypeScript · Maximalist Personal Harness | 强化 Agent loop + 大型 session maintenance 状态机 | compact/handoff/shake/snapcompact + 四种 memory backend | Approval 完整但默认 yolo;主 Agent 宿主执行 | 大工具面;shared/exclusive 并发与 pre-dispatch 改写 | MCP 配置迁移 + 进程内 extensions/hooks/custom tools/marketplace | Task batch/async/yield + 预算/park/冷恢复 + 兄弟 hub | 树形账本 + OTEL GenAI spans/cost/run coverage |
| Claude Code(复原)JS · Reconstructed Claude Harness | 持续消息变换;流中提前工具;补齐不完整 result | snip→tool slimming→memory→autocompact 阶梯 | 真实适配但默认关闭;包装失败可继续无沙箱 | Builtin+MCP 确定性排序;规则→自检→安全→模式 | Plugin 复合包 + Skills 按需 + 多 transport MCP | 独立 query runtime;sync/async/fork/worktree | append-only JSONL 树 + sidechain + OTEL/Perfetto/Langfuse |
| PiTypeScript · Embeddable Agent Kernel | 低层 steering/tool/follow-up;上层 AgentHarness turn boundary | 输出预留;不切 tool result;overflow 只自动重试一次 | 宿主 shell/filesystem;trust 保护项目可执行资源 | 默认并行;sequential 才串行;唯一精确 Edit | 同进程扩展面广;固定提交无内建 MCP | 子进程示例,不是内建控制平面 | append-only JSONL 树 + 事件/输出模式 |
| OpenAI CodexRust · Secure Multi-Agent Runtime | turn 内多 step;不可漂移 snapshot;流式工具 future | COW 历史;配对/多模态成本;本地压缩自救 | 审批/permission profile 双轴;三平台原生 OS 沙箱 | typed runtime;读并行/写排他;visible/dispatch 分离 | MCP required/auth/revision + Skills/Plugins/Extensions/Hooks | 共享 AgentControl 线程树;fork/message/wait/limiter | JSONL rollout + 多库 SQLite + 全链路 telemetry |
| Gemini CLITypeScript · Scheduler + Context Pipeline | 递归 sendMessageStream;100 turn 上限;loop 恢复一次 | Legacy 摘要 + 新图/流水线/GC/蒸馏/真实 token 校准 | Policy 细;三平台真实隔离;默认不开启但净化 env | Turn 解析与 event-driven Scheduler 分离 | MCP/OAuth + 能力包扩展热装卸 + 分层 memory/skills/hooks | 可订阅/重放/中止 AgentProtocol;本地后台 | 增量 JSONL/checkpoint/rewind + 多后端 OTEL |
| JCodeTypeScript · Recoverable Memory + Swarm Agent | 先写盘;断流撤销半截再重播;多类止损上限 | prefix/tail 缓存;cursor compact;三策略压缩;后台 memory | session allow/disable + external gate;危险命令拒绝;无 OS sandbox | typed registry;普通串行;batch 最多 10 并发;双输出预算 | 共享/会话 MCP + 多生态 skills + dynamic memory | 轻 swarm + artifact/audit deep DAG + heartbeat 回收 | snapshot + JSONL journal salvage/self-heal + metrics/telemetry |
| Kimi CLIPython · Checkpointed Long-running Agent | 带 checkpoint 的多 step;notification injection;D-Mail 回退 | 可挽救 JSONL;摘要保尾;压缩后恢复活动后台任务 | 统一 approval/YOLO/AFK/Plan gate;默认本地 KAOS 非 OS 沙箱 | 动态 toolset;同 step 并发去重;3/5/8/12 重复止损 | 延迟 MCP + plugin subprocess + command/wire hooks | coder/explore/plan allowlist;持久可恢复、前后台子 Agent | wire/trace 全链路 + 默认匿名 telemetry 可关闭 |
| DeepSeek-ReasonixGo · DeepSeek-native Cache-first Harness | Agent Run + typed event stream;Delivery readiness、Auto Guard 与 repeat guards | prefix cache stable;0.5/0.6/0.8/0.9 分层清理;固定 16K tail + summary/archive | workspace roots + OS sandbox/escape approver;Plan 不是权限边界;运行可按配置放宽 | parse→proxy/policy→delivery/recovery/permission→lease/hooks/preview→execute/evidence | MCP stdio/HTTP/SSE + capability proxy + Skills/Plugin registry + Hooks | Coordinator planner/executor + read-only parallel_tasks(64 cap)+ task depth/scheduler | typed events + evidence receipts + JSONL sessions/checkpoints + jobs/telemetry |
| CodeWhaleRust · DeepSeek-native Governed Fleet Harness | 事件驱动 Engine;流式 turn + tool admission + goal continuation | ContextBudget 预留输出/安全余量;compaction + working-set pins + prefix fingerprint | Seatbelt / bwrap / 可选 OpenSandbox;workspace trust + execpolicy + approval | Typed registry → catalog surface → caller/approval/resource admission → execute/evidence | MCP stdio/HTTP/SSE + plugins + skills + hooks + workflow/remote control | SubAgentRuntime/Fleet/Goal + mailbox + max depth/concurrency/budget | typed Event channel + Turn receipts + JSONL/session/snapshots + cost/telemetry |
| Prime AgentTypeScript · Extension-first Pi Harness / RLM Daemon Agent | AgentMessage loop;steer → tool batch → follow-up → continuation | 动态 transform;reserve 16K、keep 20K;结构化 summary + branch tree | 默认 host shell;BashOperations 可替换,timeout/abort 不是 OS 隔离 | 参数验证 → before hook → 串并行执行 → after hook / terminate | Extensions + Skills/Prompts/Themes + MCP/OAuth provider bridge | RLM child registry + daemon resident workers + prompt admission | typed lifecycle events + JSONL tree + compaction/RLM/telemetry |
| DeepAgentsPython · LangGraph Middleware + Pluggable Backend Coding Harness | create_agent graph;middleware before/after model/tool 与 task subgraph | model-aware 85%/10% 压缩;history/media offload;manual compact event | SDK 默认 StateBackend 无 shell;CLI local host shell / remote sandbox 显式分支 | 结构化 ls/read/write/edit/glob/grep;SandboxBackend 才有 execute/task | Skills progressive disclosure + MCP trust/discovery + versioned plugins | declarative/compiled/async subagents;private state + result Command | LangSmith metadata + SQLite checkpoint index + cost event + artifacts |
优先研究 step snapshot、双轴权限、原生沙箱、rollout 与 AgentControl。
重点是 VM、临时模型密钥、owner gate、流回放与租户审计,而非重写 Agent loop。
内核边界和 extension API 极适合二次开发,但需要自行补安全、MCP 和多 Agent 控制面。
对比消息事件模型、MCP 生命周期、扩展能力包与 scheduler。
研究 checkpoint、D-Mail、后台任务、memory、journal 和多策略 context maintenance。
Repo Map、编辑协议、dry-run、lint/test/commit 链仍是最简洁可靠的范式。
Read-before-Edit、禁整文件覆写、知识排序与本地 context probing 很实用。
前者适合研究复杂权限/子 Agent,后者适合 Actor、worktree 和插件能力包。
优先研究 reasoning_content 回放、cache-stable prefix、分层压缩、MCP lazy catalog 与 Delivery evidence gate。
重点研究 ContextBudget、Typed ToolAuthorityEnvelope、reviewed plugin recheck、Mailbox 和跨进程 resource admission。
优先研究 provider-neutral loop、request-time context transform、JSONL branch session、RLM registry 与 resident worker recovery。
优先研究 BackendProtocol、85/10 压缩归档、filesystem permissions/HITL、delegation-aware tool allowlist 和 MCP trust。
不直接复制任何一个项目。以 Codex 的安全/rollout 为底,以 Pi 的可嵌入内核为 API 形态,吸收 Kimi/JCode 的恢复、Gemini 的 scheduler、Aider 的 Repo Map、Open Interpreter 的多 Harness adapter,并把所有扩展放进可治理的能力层。
workspace-write + network deny;approval 与 capability 分离;无 UI 时 fail-closed;沙箱失败不允许静默降级。
所有用户消息、模型 part、工具 lifecycle、审批、文件 diff、子 Agent 通信、压缩与回滚进入 append-only log。
同一步的上下文、工具清单、权限、MCP revision 和环境必须不可漂移,下一 step 才应用动态变化。
模型可见 schema 与执行 registry 分离;adapter 只翻译,不得绕过权限、沙箱、幂等、输出预算和审计。
预算器、repo retrieval、工具 prune、summary、recent tail、active-task rehydrate、真实 token 校准形成可测试流水线。
spawn 必须声明角色、fork 范围、工具 allowlist、预算、隔离、artifact 和完成条件;并发数与驻留数分开治理。
事件账本、typed tools、step snapshot、精确 edit、Git diff、重试分类、token 预算。
先证明一次任务能完整恢复。approval/capability 双轴、workspace sandbox、network policy、secret scope、hook fail-closed。
再证明危险任务不会越界。MCP revision、Skills metadata-first、插件 manifest、输出预算、SSRF、签名与 provenance。
扩展前先把供应链治理做成平台能力。线程树/DAG、预算、worktree、artifact、取消/恢复、trace replay、golden workflow 与回归检测。
最后扩大并行度,并用证据证明收益。MCP 原生、扩展友好、单循环清楚;安全边界更依赖工具检查而非 OS 沙箱。
以 Git、Repo Map 和可替换编辑协议取胜;不是工具调用型自治平台。
Actor 化运行时、内核沙箱和插件能力包组合先进,但沙箱失败时会降级继续。
Codex 安全底盘之上做多 Harness 协议仿真;独特价值是“统一 IR,模型原生手感”。
用小而硬的约束增强 Pi,特别适合本地小模型;安全仍主要是规则而非隔离。
它是把多种 CLI 放入远程 VM 的控制平面;Agent 智能来自所选 CLI,平台负责隔离、凭据与协作。
持久化 message-parts 状态机与插件生态很强;默认宿主执行是最明显安全缺口。
机制覆盖面最广的一类个人 Harness:上下文策略、多方言、Agent hub、OTEL 都很强,但默认 yolo/宿主执行偏激进。
从复原源码可见极深的权限、上下文和子 Agent 设计;但来源与许可边界使其不能等同官方源码。
优秀的可嵌入 Agent Harness 内核与 SDK;默认安全、MCP 和内建多 Agent 控制面刻意保持轻量。
安全、可恢复、可观测和多 Agent 控制面最均衡的企业级基座之一。
工具调度、PolicyEngine、扩展热装卸和新图式上下文系统都很有研究价值;默认 sandbox 仍关闭。
恢复、memory 与 swarm 设计非常激进;安全边界偏应用层,默认没有 OS 沙箱。
检查点、D-Mail、后台任务和持久子 Agent 让长任务体验突出;默认 KAOS 仍是宿主执行。
DeepSeek 原生、缓存优先、Go 单二进制与多前端控制面;把低 token 成本、可恢复长会话和插件/子 Agent 治理做成同一套运行时。
Rust 单体工作台以 DeepSeek 原生路由为核心,把事件驱动主循环、预算化上下文、执行策略与多 Agent Fleet 放在同一控制面。
把 provider-neutral Agent Loop、可扩展 AgentSession、结构化 compaction、RLM 子 Agent 与 resident daemon 组合成一个可嵌入的 TypeScript coding harness。
以 LangGraph middleware 为编排骨架、以 BackendProtocol 为执行抽象,把文件工具、压缩归档、权限/HITL、子 Agent、Skills/MCP/Plugins 和 CLI 控制面组合起来。
每个仓库固定到一个 40 位 commit;README 仅作入口。机器先扫描全仓关键字、manifest、指令/插件候选与语言分布,人工再沿“入口 → 主循环 → provider → context → tools → permission/sandbox → extensions → subagents → persistence/telemetry → tests”读调用链。
所有 466 条结论进入统一 JSON Schema 证据账本;1319 处引用在生成前逐一验证文件存在、行号有效、commit 匹配。每个独立报告直接粘贴固定提交的关键源码,并明确事实、推断、风险与限制。
没有把服务端不可见能力、prompt 自述、README 功能、未启用代码或示例扩展误写成默认运行时事实。claude-code-best/claude-code 以“复原仓库”标注,openinterpreter 以当前 Rust/Codex 分叉身份分析。