OpenClaw Research Poster
2026-06-28 · AI Agent 工程方法论
Loop Engineering
把 Agent 从一次对话,变成可维护、可观察、可回放的任务闭环。
Core thesis
Loop 不是更长的 prompt;它是带模型能力、预算和审计边界的任务运行时。
01
基础知识
1
发现从 CI、PR、issue、日志或定时任务找到下一步。2
计划决定分给谁、先做什么、用哪些工具和预算。3
执行把任务交给 Agent、CLI、脚本或子代理处理。4
验证用测试、证据、独立 reviewer 判断是否跑偏。5
记录写回 state、run log、artifact、失败原因和下一步。不是你去 prompt agent,而是设计那个会 prompt agent 的 loop
02
对比关系
Harness
单次执行的可靠性
关注一次 run:prompt、tools、sandbox、context policy、hooks、tests、output schema。核心问题:这次执行是否可控、可复现、可回滚。
Loop
跨时间的持续运营
关注多次 run:scheduler、state store、budget、queue、verification、notification、handoff、learning。核心问题:系统能否持续推进并停止。
Relationship
不是二选一
Environment定义可见世界、权限边界、失败成本
constrains
Harness承载一次 Agent run:工具、沙箱、测试
scheduled by
Loop调度多次 run;回写状态、指标、handoff
03
具体实现
Runtime sketch
CLI 调度 + LangGraph 状态流
外层用 cron / GitHub Actions / openclaw cron 周期触发;内层用 State、Node、Edge 建模 collect → classify → draft → verify → commit / handoff。每轮都读取 repo、CI、PR、issue、STATE.md,并写入 run log。
Loop plumbing
五块工程积木
自动化重复跑;空结果归档;有结果进 triage。
隔离仓独立 checkout,避免任务互相踩文件。
技能项目规则、流程、脚本和资产写下来。
子代理research / write / verify 分开权限。
状态phase、evidence、attempt、budget 外置。
04
实践落地
Rollout
先可信,再自动
L1只读、归类、写报告、提醒。
L2可开低风险 PR,但不自动合并。
L3allowlist 内半无人值守,强 gate。
Guardrails
必须显式写进系统
1
读写分级:读日志自动;写评论、开 PR、改配置进审批。
2
副作用后置:collect / classify / draft / verify 之后再提交。
3
停止条件:done、blocked、over budget、low confidence。
4
指标:误报率、遗漏率、人工接管率、token 成本、恢复时间。
05
案例
触发CI job failed;写入 runId、repo、commit、PR、owner。
收集拉取失败日志、最近 diff、依赖变更、历史相似失败。
分类test / dependency / permission / infra / flaky / unknown。
建议输出证据链、影响面、修复方向、可执行命令。
验证复跑最小测试;权限、部署、账单、生产配置直接 handoff。
提交L1 发分流报告;L2 开候选 PR;trace 进入后续规则改进。