CODING AGENT HARNESS · 18 REPOSITORIESSOURCE AUDIT / 2026
XVIII
横向总报告 · 固定提交源码审计

Coding Agent
Harness 全景研究

不是产品功能清单,而是从主循环、上下文、工具、沙箱、MCP、指令、插件、子 Agent、持久化与观测一路钻进实现后的工程比较。

18独立仓库
466源码结论
1319精确引用
481被引文件
36验证技术图
01 · SYNTHESIS

真正拉开差距的不是模型,而是 Harness 的“控制面”

18 份源码显示,Coding Agent 的竞争已经从“会不会调用 shell”转向五个控制面:稳定上下文、可证明的权限边界、持久任务状态、可组合扩展、受治理的多 Agent。模型只是推理内核;Harness 决定它能否可靠交付。

01

上下文不再是 messages

成熟实现会维护调用/结果配对、真实 token 预算、摘要保尾、工具结果瘦身、checkpoint、world state,甚至把活动后台任务重新注入压缩后的会话。

02

Approval ≠ Sandbox

Aider、OpenCode、Pi、Kimi 等可以有规则或询问,但默认仍在宿主执行;Codex/Open Interpreter、Gemini 可选沙箱、Grok、MonkeyCode 的隔离边界完全不同。

03

工具菜单 ≠ 执行注册表

先进实现把模型可见 schema、隐藏兼容 handler、权限判定、并发 admission 和观测分开;Open Interpreter 更把多套 Harness 工具名翻译到统一 runtime。

04

多 Agent 必须有资源合同

真正的子 Agent 需要独立上下文、持久身份、深度/并发/预算限制、消息协议、取消、恢复和 artifact;只做一次双模型串行不等于控制面。

05

恢复来自事件事实源

JSONL rollout/journal、tree session、checkpoint 与 shadow Git 是高频答案。数据库适合查询,事件账本更适合重建“当时究竟发生了什么”。

06

扩展面就是供应链面

MCP、Skills、Plugins、Hooks、Extensions 能力越强,越需要来源、预算、签名、secret scope、输出限额、SSRF 和 fail-closed 的治理。

02 · IMPLEMENTATION MATRIX

18 种实现路径,逐维对照

横向滚动查看。每个单元格是源码结论的压缩摘要;点击 Agent 名进入带代码摘录的完整报告。

Agent / 类型主循环上下文安全与沙箱工具执行MCP / 扩展子 Agent持久化 / 观测
GooseRust · MCP-first 通用 Agent 单一流式循环;完整 tool call 后并发;防失控上限 80% 结构化压缩;超窗逐级剥离工具结果 无强制工作区边界;Auto / Approve / SmartApprove 同一模型 turn 多工具检查后并发 MCP + Skills + Hooks 都很完整 独立子 Agent + 子会话 SQLite/WAL + cost + tracing
AiderPython · Git-native Pair Programmer 交互外环 + 有界 reflection;固定 lint/test/commit 交付链 ChatChunks + 符号图 PageRank Repo Map + 二分 token 预算 宿主 shell;聊天文件集是主要写边界 编辑协议家族;dry-run → 授权 → 落盘 LiteLLM 广,但没有核心 MCP/函数工具循环 Architect → Editor 顺序双模型 Git 事务、本地历史、LLM 原始日志、成本
Grok BuildRust · Actor + Secure Worktree Agent 长期 SessionActor;prepare → parallel dispatch → post-flight 预热、两阶段压缩、任务状态重建与恢复梯子 真实内核文件系统/网络隔离;不支持或失败可降级 参数恢复层;PreToolUse 可在权限前阻断 Plugin 同包 Skills/Commands/Agents/Hooks/MCP/LSP 后台、恢复、限深与 worktree 子 Agent 工具/权限/压缩/沙箱结构化事件
Open InterpreterRust · Multi-Harness Compatibility Layer Codex turn/step 快照循环;Harness 前后置整形 调用配对、多模态裁剪、Harness-aware compact 审批与权限 profile 双轴;三平台原生沙箱 Visible spec / dispatch registry 分离;大规模 aliases MCP/Apps/Plugins/Skills/Hooks 共用 step snapshot 共享 AgentControl 线程树;Harness Agent/Task alias FileChange lifecycle + rollout/SQLite/trace + 独立 analytics
Little CoderTypeScript · Local-model Pi Extension Pi 内核 + 动态知识尾部注入 + 80% watchdog 大 Read 压到 30 行;知识按失败/近期工具/意图排序 宿主 bash;shell 分段白名单与重定向检测 禁止整文件覆写;Edit 强制先 Read 默认固定扩展;Pi 生态桥显式 opt-in 独立进程子 Agent;Plan/Research 多波次 结构化证据、质量 steer、best-effort checkpoint
MonkeyCodeGo/TS · Remote Agent Control Plane DB 预登记 → VM → Redis 交接 → 选定 CLI 只知道窗口上限;压缩和 memory 交给内层 Agent 外层 VM 是主边界;内层 Codex sandbox 显式关闭 MCP 有效集、幂等 replay、状态审计 Rules/Skills/Plugins 分轨;global/team/user 覆盖 owner write gate + 历史回放 + 实时流;无平台子 Agent 协议流旁路用量归因 + OTLP allowlist
OpenCodeTypeScript · Persistent Session Platform 持久化消息状态驱动;每 step 重建 agent/tools/system 可用输入窗阈值;摘要保尾;工具输出后台 prune 默认 ask 权限,但 shell 直接宿主执行 Bash/PowerShell AST 扫描;Edit diff→权限→格式化→LSP AI SDK providers + MCP OAuth/prompts/resources + 高权限 plugins 独立持久子 session;前后台、限深、递归取消 Session DB + shadow Git patch/revert + 显式 share
Oh My PiTypeScript · Maximalist Personal Harness 强化 Agent loop + 大型 session maintenance 状态机 compact/handoff/shake/snapcompact + 四种 memory backend Approval 完整但默认 yolo;主 Agent 宿主执行 大工具面;shared/exclusive 并发与 pre-dispatch 改写 MCP 配置迁移 + 进程内 extensions/hooks/custom tools/marketplace Task batch/async/yield + 预算/park/冷恢复 + 兄弟 hub 树形账本 + OTEL GenAI spans/cost/run coverage
Claude Code(复原)JS · Reconstructed Claude Harness 持续消息变换;流中提前工具;补齐不完整 result snip→tool slimming→memory→autocompact 阶梯 真实适配但默认关闭;包装失败可继续无沙箱 Builtin+MCP 确定性排序;规则→自检→安全→模式 Plugin 复合包 + Skills 按需 + 多 transport MCP 独立 query runtime;sync/async/fork/worktree append-only JSONL 树 + sidechain + OTEL/Perfetto/Langfuse
PiTypeScript · Embeddable Agent Kernel 低层 steering/tool/follow-up;上层 AgentHarness turn boundary 输出预留;不切 tool result;overflow 只自动重试一次 宿主 shell/filesystem;trust 保护项目可执行资源 默认并行;sequential 才串行;唯一精确 Edit 同进程扩展面广;固定提交无内建 MCP 子进程示例,不是内建控制平面 append-only JSONL 树 + 事件/输出模式
OpenAI CodexRust · Secure Multi-Agent Runtime turn 内多 step;不可漂移 snapshot;流式工具 future COW 历史;配对/多模态成本;本地压缩自救 审批/permission profile 双轴;三平台原生 OS 沙箱 typed runtime;读并行/写排他;visible/dispatch 分离 MCP required/auth/revision + Skills/Plugins/Extensions/Hooks 共享 AgentControl 线程树;fork/message/wait/limiter JSONL rollout + 多库 SQLite + 全链路 telemetry
Gemini CLITypeScript · Scheduler + Context Pipeline 递归 sendMessageStream;100 turn 上限;loop 恢复一次 Legacy 摘要 + 新图/流水线/GC/蒸馏/真实 token 校准 Policy 细;三平台真实隔离;默认不开启但净化 env Turn 解析与 event-driven Scheduler 分离 MCP/OAuth + 能力包扩展热装卸 + 分层 memory/skills/hooks 可订阅/重放/中止 AgentProtocol;本地后台 增量 JSONL/checkpoint/rewind + 多后端 OTEL
JCodeTypeScript · Recoverable Memory + Swarm Agent 先写盘;断流撤销半截再重播;多类止损上限 prefix/tail 缓存;cursor compact;三策略压缩;后台 memory session allow/disable + external gate;危险命令拒绝;无 OS sandbox typed registry;普通串行;batch 最多 10 并发;双输出预算 共享/会话 MCP + 多生态 skills + dynamic memory 轻 swarm + artifact/audit deep DAG + heartbeat 回收 snapshot + JSONL journal salvage/self-heal + metrics/telemetry
Kimi CLIPython · Checkpointed Long-running Agent 带 checkpoint 的多 step;notification injection;D-Mail 回退 可挽救 JSONL;摘要保尾;压缩后恢复活动后台任务 统一 approval/YOLO/AFK/Plan gate;默认本地 KAOS 非 OS 沙箱 动态 toolset;同 step 并发去重;3/5/8/12 重复止损 延迟 MCP + plugin subprocess + command/wire hooks coder/explore/plan allowlist;持久可恢复、前后台子 Agent wire/trace 全链路 + 默认匿名 telemetry 可关闭
DeepSeek-ReasonixGo · DeepSeek-native Cache-first Harness Agent Run + typed event stream;Delivery readiness、Auto Guard 与 repeat guards prefix cache stable;0.5/0.6/0.8/0.9 分层清理;固定 16K tail + summary/archive workspace roots + OS sandbox/escape approver;Plan 不是权限边界;运行可按配置放宽 parse→proxy/policy→delivery/recovery/permission→lease/hooks/preview→execute/evidence MCP stdio/HTTP/SSE + capability proxy + Skills/Plugin registry + Hooks Coordinator planner/executor + read-only parallel_tasks(64 cap)+ task depth/scheduler typed events + evidence receipts + JSONL sessions/checkpoints + jobs/telemetry
CodeWhaleRust · DeepSeek-native Governed Fleet Harness 事件驱动 Engine;流式 turn + tool admission + goal continuation ContextBudget 预留输出/安全余量;compaction + working-set pins + prefix fingerprint Seatbelt / bwrap / 可选 OpenSandbox;workspace trust + execpolicy + approval Typed registry → catalog surface → caller/approval/resource admission → execute/evidence MCP stdio/HTTP/SSE + plugins + skills + hooks + workflow/remote control SubAgentRuntime/Fleet/Goal + mailbox + max depth/concurrency/budget typed Event channel + Turn receipts + JSONL/session/snapshots + cost/telemetry
Prime AgentTypeScript · Extension-first Pi Harness / RLM Daemon Agent AgentMessage loop;steer → tool batch → follow-up → continuation 动态 transform;reserve 16K、keep 20K;结构化 summary + branch tree 默认 host shell;BashOperations 可替换,timeout/abort 不是 OS 隔离 参数验证 → before hook → 串并行执行 → after hook / terminate Extensions + Skills/Prompts/Themes + MCP/OAuth provider bridge RLM child registry + daemon resident workers + prompt admission typed lifecycle events + JSONL tree + compaction/RLM/telemetry
DeepAgentsPython · LangGraph Middleware + Pluggable Backend Coding Harness create_agent graph;middleware before/after model/tool 与 task subgraph model-aware 85%/10% 压缩;history/media offload;manual compact event SDK 默认 StateBackend 无 shell;CLI local host shell / remote sandbox 显式分支 结构化 ls/read/write/edit/glob/grep;SandboxBackend 才有 execute/task Skills progressive disclosure + MCP trust/discovery + versioned plugins declarative/compiled/async subagents;private state + result Command LangSmith metadata + SQLite checkpoint index + cost event + artifacts
03 · DECISION MAP

不要问“谁最好”,要问“你在建设哪一种产品”

企业安全执行底座Codex / Open Interpreter

优先研究 step snapshot、双轴权限、原生沙箱、rollout 与 AgentControl。

远程多租户平台MonkeyCode

重点是 VM、临时模型密钥、owner gate、流回放与租户审计,而非重写 Agent loop。

可嵌入 SDKPi

内核边界和 extension API 极适合二次开发,但需要自行补安全、MCP 和多 Agent 控制面。

插件与多前端产品OpenCode / Goose / Gemini

对比消息事件模型、MCP 生命周期、扩展能力包与 scheduler。

长任务与记忆Kimi / JCode / Oh My Pi

研究 checkpoint、D-Mail、后台任务、memory、journal 和多策略 context maintenance。

Git 结对编程Aider

Repo Map、编辑协议、dry-run、lint/test/commit 链仍是最简洁可靠的范式。

本地小模型Little Coder

Read-before-Edit、禁整文件覆写、知识排序与本地 context probing 很实用。

机制研究Claude 复原 / Grok Build

前者适合研究复杂权限/子 Agent,后者适合 Actor、worktree 和插件能力包。

DeepSeek 原生与低成本长会话DeepSeek-Reasonix

优先研究 reasoning_content 回放、cache-stable prefix、分层压缩、MCP lazy catalog 与 Delivery evidence gate。

治理型 Fleet 与可恢复执行CodeWhale

重点研究 ContextBudget、Typed ToolAuthorityEnvelope、reviewed plugin recheck、Mailbox 和跨进程 resource admission。

可嵌入 TypeScript / RLM daemonPrime Agent

优先研究 provider-neutral loop、request-time context transform、JSONL branch session、RLM registry 与 resident worker recovery。

Middleware + pluggable backendDeepAgents

优先研究 BackendProtocol、85/10 压缩归档、filesystem permissions/HITL、delegation-aware tool allowlist 和 MCP trust。

04 · OUR AGENT BLUEPRINT

建议自研:事件溯源的安全多 Agent Harness

不直接复制任何一个项目。以 Codex 的安全/rollout 为底,以 Pi 的可嵌入内核为 API 形态,吸收 Kimi/JCode 的恢复、Gemini 的 scheduler、Aider 的 Repo Map、Open Interpreter 的多 Harness adapter,并把所有扩展放进可治理的能力层。

P0 · 安全默认值

workspace-write + network deny;approval 与 capability 分离;无 UI 时 fail-closed;沙箱失败不允许静默降级。

P0 · 单一事实源

所有用户消息、模型 part、工具 lifecycle、审批、文件 diff、子 Agent 通信、压缩与回滚进入 append-only log。

P1 · Step Snapshot

同一步的上下文、工具清单、权限、MCP revision 和环境必须不可漂移,下一 step 才应用动态变化。

P1 · Tool IR

模型可见 schema 与执行 registry 分离;adapter 只翻译,不得绕过权限、沙箱、幂等、输出预算和审计。

P1 · Context Pipeline

预算器、repo retrieval、工具 prune、summary、recent tail、active-task rehydrate、真实 token 校准形成可测试流水线。

P2 · Multi-Agent Contract

spawn 必须声明角色、fork 范围、工具 allowlist、预算、隔离、artifact 和完成条件;并发数与驻留数分开治理。

05 · BUILD ROADMAP

从能跑到可治理,分四个里程碑

M1

可靠单 Agent

事件账本、typed tools、step snapshot、精确 edit、Git diff、重试分类、token 预算。

先证明一次任务能完整恢复。
M2

安全执行面

approval/capability 双轴、workspace sandbox、network policy、secret scope、hook fail-closed。

再证明危险任务不会越界。
M3

扩展与连接器

MCP revision、Skills metadata-first、插件 manifest、输出预算、SSRF、签名与 provenance。

扩展前先把供应链治理做成平台能力。
M4

多 Agent 与评测

线程树/DAG、预算、worktree、artifact、取消/恢复、trace replay、golden workflow 与回归检测。

最后扩大并行度,并用证据证明收益。
06 · AGENT PROFILES

逐个 Agent 的优劣势与采用建议

01
Rust · MCP-first 通用 Agent · 18 FINDINGS

Goose

MCP 原生、扩展友好、单循环清楚;安全边界更依赖工具检查而非 OS 沙箱。

按教程标准学习这一实现 →

最佳场景
重连接器、桌面交互、企业工具集成
上下文
80% 结构化压缩;超窗逐级剥离工具结果
执行安全
无强制工作区边界;Auto / Approve / SmartApprove
协作
独立子 Agent + 子会话
强项
  • MCP 生命周期完整
  • 权限检查顺序明确
  • 扩展与 Skills 生态兼容
风险
  • 内置开发工具缺 OS 级强制边界
  • SmartApprove 仍依赖模型判断
  • 单循环对复杂调度的表达有限
建议借鉴
  • 统一 MCP 工具命名空间
  • 危险优先的检查流水线
  • 结构化压缩指标
02
Python · Git-native Pair Programmer · 16 FINDINGS

Aider

以 Git、Repo Map 和可替换编辑协议取胜;不是工具调用型自治平台。

按教程标准学习这一实现 →

最佳场景
强调可审查 diff、Git 工作流、低复杂度结对编程
上下文
ChatChunks + 符号图 PageRank Repo Map + 二分 token 预算
执行安全
宿主 shell;聊天文件集是主要写边界
协作
Architect → Editor 顺序双模型
强项
  • Repo Map 算法成熟
  • 编辑事务与 Git 恢复强
  • 协议简单可解释
风险
  • 无 OS 沙箱
  • 连接器/多 Agent 平台能力弱
  • 自治长任务与并发工具有限
建议借鉴
  • Repo Map 的预算化检索
  • dry-run 编辑事务
  • Git 作为恢复原语
03
Rust · Actor + Secure Worktree Agent · 17 FINDINGS

Grok Build

Actor 化运行时、内核沙箱和插件能力包组合先进,但沙箱失败时会降级继续。

按教程标准学习这一实现 →

最佳场景
长任务、工作树隔离、可组合研发插件
上下文
预热、两阶段压缩、任务状态重建与恢复梯子
执行安全
真实内核文件系统/网络隔离;不支持或失败可降级
协作
后台、恢复、限深与 worktree 子 Agent
强项
  • Actor 生命周期清晰
  • Plan 与 Always Approve 解耦
  • 插件交付面完整
风险
  • 沙箱 fail-open 降级
  • 插件面大、供应链风险高
  • Actor 状态与恢复复杂
建议借鉴
  • 三段式工具执行
  • 任务状态型压缩
  • 插件能力包 manifest
04
Rust · Multi-Harness Compatibility Layer · 26 FINDINGS

Open Interpreter

Codex 安全底盘之上做多 Harness 协议仿真;独特价值是“统一 IR,模型原生手感”。

按教程标准学习这一实现 →

最佳场景
多模型 A/B、Harness 研究、Codex 生态兼容
上下文
调用配对、多模态裁剪、Harness-aware compact
执行安全
审批与权限 profile 双轴;三平台原生沙箱
协作
共享 AgentControl 线程树;Harness Agent/Task alias
强项
  • 协议与 Harness 三层解耦
  • 兼容工具不绕过沙箱/观测
  • 复用成熟 Codex 控制面
风险
  • 适配矩阵爆炸
  • catalog 与 routing 存在接口不一致
  • 独立 analytics 默认启用
建议借鉴
  • 内部统一 Prompt/ResponseItem IR
  • 适配器单一集成点
  • Harness-aware compaction tests
05
TypeScript · Local-model Pi Extension · 20 FINDINGS

Little Coder

用小而硬的约束增强 Pi,特别适合本地小模型;安全仍主要是规则而非隔离。

按教程标准学习这一实现 →

最佳场景
llama.cpp/Ollama、小模型、本地受控编码
上下文
大 Read 压到 30 行;知识按失败/近期工具/意图排序
执行安全
宿主 bash;shell 分段白名单与重定向检测
协作
独立进程子 Agent;Plan/Research 多波次
强项
  • 为小模型补充确定性不变量
  • 知识注入兼顾 KV cache
  • 多 Agent 工作流轻巧
风险
  • 无 OS 沙箱
  • checkpoint 非事务且有路径兼容缺口
  • 文本 tool call 只能纠偏
建议借鉴
  • Read-before-Edit
  • 禁止整文件覆写
  • 失败驱动知识排序
06
Go/TS · Remote Agent Control Plane · 21 FINDINGS

MonkeyCode

它是把多种 CLI 放入远程 VM 的控制平面;Agent 智能来自所选 CLI,平台负责隔离、凭据与协作。

按教程标准学习这一实现 →

最佳场景
多人远程 Coding Agent SaaS、隔离租户、统一审计
上下文
只知道窗口上限;压缩和 memory 交给内层 Agent
执行安全
外层 VM 是主边界;内层 Codex sandbox 显式关闭
协作
owner write gate + 历史回放 + 实时流;无平台子 Agent
强项
  • 真实 VM 租户隔离
  • 上游凭据不下发给任务
  • 多 CLI 控制平面
风险
  • Taskflow 失败吞掉可滞留 processing
  • 安全语义继承内层 CLI
  • 平台不治理子 Agent
建议借鉴
  • 任务临时 LLM 密钥
  • owner write gate
  • 资源三层覆盖与 zip-slip 防护
07
TypeScript · Persistent Session Platform · 28 FINDINGS

OpenCode

持久化 message-parts 状态机与插件生态很强;默认宿主执行是最明显安全缺口。

按教程标准学习这一实现 →

最佳场景
多前端、插件市场、持久任务与可回退编辑
上下文
可用输入窗阈值;摘要保尾;工具输出后台 prune
执行安全
默认 ask 权限,但 shell 直接宿主执行
协作
独立持久子 session;前后台、限深、递归取消
强项
  • 消息部件事件模型细
  • Shell 权限解析扎实
  • 影子 Git 可回退
风险
  • 无内建 OS 沙箱
  • 插件进程内高权限
  • 远程 MCP 缺 SSRF 私网拦截
建议借鉴
  • message-part 事件模型
  • doom-loop 二次确认
  • step 前后 shadow Git
08
TypeScript · Maximalist Personal Harness · 23 FINDINGS

Oh My Pi

机制覆盖面最广的一类个人 Harness:上下文策略、多方言、Agent hub、OTEL 都很强,但默认 yolo/宿主执行偏激进。

按教程标准学习这一实现 →

最佳场景
高级个人用户、复杂长任务、多 Agent 实验
上下文
compact/handoff/shake/snapcompact + 四种 memory backend
执行安全
Approval 完整但默认 yolo;主 Agent 宿主执行
协作
Task batch/async/yield + 预算/park/冷恢复 + 兄弟 hub
强项
  • 上下文维护策略最丰富
  • Agent 协作控制面完整
  • 观测与机制测试密集
风险
  • 默认 yolo
  • 隔离默认 none
  • 同进程扩展供应链风险
建议借鉴
  • 多策略 context maintenance
  • 兄弟 Agent hub
  • run coverage 与成本 span
09
JS · Reconstructed Claude Harness · 25 FINDINGS

Claude Code(复原)

从复原源码可见极深的权限、上下文和子 Agent 设计;但来源与许可边界使其不能等同官方源码。

按教程标准学习这一实现 →

最佳场景
研究 Claude Code 机制与多 Agent/权限设计
上下文
snip→tool slimming→memory→autocompact 阶梯
执行安全
真实适配但默认关闭;包装失败可继续无沙箱
协作
独立 query runtime;sync/async/fork/worktree
强项
  • 权限流水线层次深
  • 子 Agent 隔离语义丰富
  • 长上下文恢复阶梯完整
风险
  • 非官方复原
  • 默认沙箱关闭且 fail-open
  • 采用与许可风险高
建议借鉴
  • 无头 Agent fail-closed
  • subagent sidechain
  • 多级压缩熔断
10
TypeScript · Embeddable Agent Kernel · 25 FINDINGS

Pi

优秀的可嵌入 Agent Harness 内核与 SDK;默认安全、MCP 和内建多 Agent 控制面刻意保持轻量。

按教程标准学习这一实现 →

最佳场景
作为自研 Agent SDK 底座、需要极强可编程性
上下文
输出预留;不切 tool result;overflow 只自动重试一次
执行安全
宿主 shell/filesystem;trust 保护项目可执行资源
协作
子进程示例,不是内建控制平面
强项
  • 内核/产品双轨清楚
  • Provider 热注册
  • 扩展 API 覆盖核心边界
风险
  • 默认无沙箱/逐命令审批
  • 无内建 MCP
  • 多 Agent 只到示例层
建议借鉴
  • turn-boundary runtime refresh
  • cut point 不切工具结果
  • 可替换 extension hooks
11
Rust · Secure Multi-Agent Runtime · 27 FINDINGS

OpenAI Codex

安全、可恢复、可观测和多 Agent 控制面最均衡的企业级基座之一。

按教程标准学习这一实现 →

最佳场景
企业内研发平台、安全执行、复杂长任务、多 Agent
上下文
COW 历史;配对/多模态成本;本地压缩自救
执行安全
审批/permission profile 双轴;三平台原生 OS 沙箱
协作
共享 AgentControl 线程树;fork/message/wait/limiter
强项
  • 权限与能力边界代码化
  • 恢复与审计事实源完整
  • 多 Agent 资源治理成熟
风险
  • 体系庞大、二次开发成本高
  • Responses 协议中心化
  • 配置与 feature surface 复杂
建议借鉴
  • StepContext 快照
  • 审批与权限双轴
  • Rollout 事实源 + SQLite 镜像
12
TypeScript · Scheduler + Context Pipeline · 28 FINDINGS

Gemini CLI

工具调度、PolicyEngine、扩展热装卸和新图式上下文系统都很有研究价值;默认 sandbox 仍关闭。

按教程标准学习这一实现 →

最佳场景
Google 生态、大型扩展平台、上下文工程研究
上下文
Legacy 摘要 + 新图/流水线/GC/蒸馏/真实 token 校准
执行安全
Policy 细;三平台真实隔离;默认不开启但净化 env
协作
可订阅/重放/中止 AgentProtocol;本地后台
强项
  • Scheduler 边界清晰
  • Policy 匹配维度丰富
  • 新上下文系统前瞻
风险
  • 默认沙箱关闭
  • 旧/新上下文并存增加复杂度
  • 同 protocol 实例不并发 stream
建议借鉴
  • 工具 scheduler 独立事件机
  • token API 反校准
  • extension capability hot reload
13
TypeScript · Recoverable Memory + Swarm Agent · 30 FINDINGS

JCode

恢复、memory 与 swarm 设计非常激进;安全边界偏应用层,默认没有 OS 沙箱。

按教程标准学习这一实现 →

最佳场景
研究型自研 Harness、复杂 swarm、长期记忆
上下文
prefix/tail 缓存;cursor compact;三策略压缩;后台 memory
执行安全
session allow/disable + external gate;危险命令拒绝;无 OS sandbox
协作
轻 swarm + artifact/audit deep DAG + heartbeat 回收
强项
  • 断流恢复细
  • memory/压缩策略完整
  • swarm DAG 治理先进
风险
  • 无 OS 沙箱
  • 系统复杂度和状态空间大
  • 外部 gate 是部署依赖
建议借鉴
  • journal 损坏自愈
  • 前缀游标压缩
  • artifact + audit swarm gate
14
Python · Checkpointed Long-running Agent · 30 FINDINGS

Kimi CLI

检查点、D-Mail、后台任务和持久子 Agent 让长任务体验突出;默认 KAOS 仍是宿主执行。

按教程标准学习这一实现 →

最佳场景
超长自主任务、后台 build、可恢复研究与编码
上下文
可挽救 JSONL;摘要保尾;压缩后恢复活动后台任务
执行安全
统一 approval/YOLO/AFK/Plan gate;默认本地 KAOS 非 OS 沙箱
协作
coder/explore/plan allowlist;持久可恢复、前后台子 Agent
强项
  • 长任务中途纠偏优秀
  • 重复调用治理具体
  • 子 Agent 生命周期完整
风险
  • 默认无 OS 沙箱
  • AFK 等同自动批准
  • 插件子进程可获新鲜凭据
建议借鉴
  • D-Mail 语义回退
  • 压缩后任务 rehydrate
  • 分阶梯重复调用刹车
15
Go · DeepSeek-native Cache-first Harness · 31 FINDINGS

DeepSeek-Reasonix

DeepSeek 原生、缓存优先、Go 单二进制与多前端控制面;把低 token 成本、可恢复长会话和插件/子 Agent 治理做成同一套运行时。

按教程标准学习这一实现 →

最佳场景
DeepSeek/OpenAI-compatible endpoint、终端/桌面/ACP、多前端企业本地部署
上下文
prefix cache stable;0.5/0.6/0.8/0.9 分层清理;固定 16K tail + summary/archive
执行安全
workspace roots + OS sandbox/escape approver;Plan 不是权限边界;运行可按配置放宽
协作
Coordinator planner/executor + read-only parallel_tasks(64 cap)+ task depth/scheduler
强项
  • DeepSeek thinking/tool-call 回放和 prefix cache 工程化
  • 安全审批、Auto Guard、证据账本串成工具流水线
  • Go 单二进制 + TUI/HTTP/Desktop/ACP 共享控制面
风险
  • 核心、桌面与服务端体量大,二次开发成本高
  • 沙箱是否强制取决于配置与宿主,不能把 Plan 当隔离
  • 外部 MCP/插件/自定义 provider 扩展供应链和网络信任面
建议借鉴
  • cache-stable system prefix + local-only transcript
  • tool pipeline + evidence receipts
  • planner/executor separation + read-only parallel tasks
16
Rust · DeepSeek-native Governed Fleet Harness · 38 FINDINGS

CodeWhale

Rust 单体工作台以 DeepSeek 原生路由为核心,把事件驱动主循环、预算化上下文、执行策略与多 Agent Fleet 放在同一控制面。

按教程标准学习这一实现 →

最佳场景
DeepSeek/OpenAI-compatible、本地 TUI/CLI、ACP/Web/remote control、长目标 Fleet
上下文
ContextBudget 预留输出/安全余量;compaction + working-set pins + prefix fingerprint
执行安全
Seatbelt / bwrap / 可选 OpenSandbox;workspace trust + execpolicy + approval
协作
SubAgentRuntime/Fleet/Goal + mailbox + max depth/concurrency/budget
强项
  • 把 DeepSeek reasoning、prefix cache、tool-call repair 做成 provider/runtime 共同边界
  • 工具 catalog、审批、资源冲突、read-repeat/stuck guard 和证据交付串成一条执行链
  • goal/Fleet/subagent/mailbox 与 session snapshots 适合长任务和可恢复协作
风险
  • Rust workspace + 超大 TUI 单体,扩展和二次开发复杂度高
  • sandbox 是否强制取决于模式/平台/配置,Full Access/Trust 仍有放宽路径
  • 工具、MCP、plugin、workflow、remote control 叠加后,治理面和测试矩阵非常大
建议借鉴
  • ContextBudget + PrefixStabilityManager 的稳定前缀与预算化输入输出
  • Typed ToolSurfacePolicy + resource admission + read-repeat/stuck guards
  • Goal/Fleet/SubAgent mailbox + snapshot/replay/evidence receipt
17
TypeScript · Extension-first Pi Harness / RLM Daemon Agent · 29 FINDINGS

Prime Agent

把 provider-neutral Agent Loop、可扩展 AgentSession、结构化 compaction、RLM 子 Agent 与 resident daemon 组合成一个可嵌入的 TypeScript coding harness。

按教程标准学习这一实现 →

最佳场景
可嵌入 SDK、长任务恢复、TUI/RPC/print/daemon 共享运行时
上下文
动态 transform;reserve 16K、keep 20K;结构化 summary + branch tree
执行安全
默认 host shell;BashOperations 可替换,timeout/abort 不是 OS 隔离
协作
RLM child registry + daemon resident workers + prompt admission
强项
  • 低层 loop 与宿主 session 边界干净
  • 压缩摘要和 JSONL 分支恢复细
  • 扩展、MCP、RLM、daemon 控制面覆盖广
风险
  • 默认 bash 是宿主 shell
  • 扩展 API 权限面很宽
  • daemon/RLM 恢复状态机维护成本高
建议借鉴
  • request-time context transform + dynamic credential
  • summary-first branch-aware session tree
  • before/after tool policy hooks 与 child registry
18
Python · LangGraph Middleware + Pluggable Backend Coding Harness · 34 FINDINGS

DeepAgents

以 LangGraph middleware 为编排骨架、以 BackendProtocol 为执行抽象,把文件工具、压缩归档、权限/HITL、子 Agent、Skills/MCP/Plugins 和 CLI 控制面组合起来。

按教程标准学习这一实现 →

最佳场景
需要可组合 backend、审批策略、远端 sandbox 和 LangGraph 生态的 coding 产品
上下文
model-aware 85%/10% 压缩;history/media offload;manual compact event
执行安全
SDK 默认 StateBackend 无 shell;CLI local host shell / remote sandbox 显式分支
协作
declarative/compiled/async subagents;private state + result Command
强项
  • middleware/BackendProtocol 正交可组合
  • 压缩归档、媒体引用和 overflow fallback 完整
  • permissions/HITL/MCP trust/插件 cache 治理细
风险
  • local shell 仍依赖部署隔离
  • permissions 对 execute backend 有明确 gap
  • middleware/profile/插件组合复杂
建议借鉴
  • Backend capability trait + CompositeBackend routes
  • metadata-first skills 与 archive pointer compaction
  • delegation-aware fs allowlist + fail-closed approval mode
APPENDIX · AUDIT CONTRACT

这份报告如何避免“只看 README”

每个仓库固定到一个 40 位 commit;README 仅作入口。机器先扫描全仓关键字、manifest、指令/插件候选与语言分布,人工再沿“入口 → 主循环 → provider → context → tools → permission/sandbox → extensions → subagents → persistence/telemetry → tests”读调用链。

所有 466 条结论进入统一 JSON Schema 证据账本;1319 处引用在生成前逐一验证文件存在、行号有效、commit 匹配。每个独立报告直接粘贴固定提交的关键源码,并明确事实、推断、风险与限制。

没有把服务端不可见能力、prompt 自述、README 功能、未启用代码或示例扩展误写成默认运行时事实。claude-code-best/claude-code 以“复原仓库”标注,openinterpreter 以当前 Rust/Codex 分叉身份分析。