强化学习的执行底座¶
Agent 训练需要大量可追踪的尝试:每次尝试从什么输入开始,调用了哪些工具,得到什么结果,为什么结束。pVisor 可以承接单次执行和证据收集,让训练器把奖励、采样与调度留在自己的控制层。
一次 rollout 的执行契约¶
输入包含 task ID、attempt ID、仓库提交或镜像摘要、工作区、Agent 命令、策略、资源预算与随机种子。输出包含结束状态、退出码、文件候选、Run Bundle、原生轨迹,以及启用捕获时的 Gateway Journal。
训练器把这些产物与模型版本、采样参数、reward 和 evaluator 版本关联。环境准备失败、权限拒绝和上游请求失败有自己的类别;评价模型解题能力时,按预先确定的规则处理这些基础设施失败。
三种可以复用的状态¶
| 状态 | 能复用什么 | 需要另行保存什么 |
|---|---|---|
| 文件 checkpoint | 固定基线上的文件候选与暂存层 | 模型上下文、外部服务状态 |
| 原生 Agent 轨迹 | 会话链路、工具调用与观察 | 可重置工作区、Agent 与模型版本 |
| VM snapshot | 相应实现支持的 VM 运行状态 | 调度元数据、模型服务、远程副作用 |
回放工具会产生新观察。研究可复现性时应固定输入与版本,同时记录工具重新执行后的差异;replay 的新观察与旧会话文字不能简单视为相同实验输入。
最小集成顺序¶
先按rollout 指南完成一个离线任务的候选收集与评分。再用独立工作区增加并发,确保每个 attempt 的文件和记录相互独立。最后接入原生 Agent 轨迹,分别验证前缀准备、工具重执行和模型续跑。
reward 由 evaluator 计算。pVisor 的成功结束是执行结果,任务得分需要题目自己的测试;文件变化也需要按任务要求判断。
需要实验证明的部分¶
测量每秒完成的 rollout、尾延迟、每个候选的磁盘与驻留内存、fork/checkpoint 成本、工具重执行成本和 reward delta。固定模型服务容量,区分执行底座与模型服务瓶颈。