# AI 热点日报：OpenAI 把 Harness 托管化，人形机器人量产驶入快车道

<!--more-->

> 本期筛选 10 条高价值动态，其中 **AI Coding 6 条、具身智能 4 条**。核心观察：编码智能体正从「写功能」走向「守安全、管长任务、降成本」的运行时基础设施层；具身智能则密集出现「量产下线」「世界模型实时驱动」等真实落地信号，2026 被公认为规模化应用元年。

## 一、AI Coding 方向

### 1. OpenAI 发布 Agents API 公测：把 Codex Harness 作为托管服务开放
**事件内容**：9 月 10 日，OpenAI 推出 Agents API 公开测试版，将 Codex 背后的 Harness（持久会话、托管沙箱、子 Agent 协同、流式进度）打包为全托管服务，开发者无需自建编排层即可运行多小时的长时程编码 Agent。按普通模型/工具/容器费率计费，无额外 Agents 费用。

**核心要点**：
- 这是「Agent Harness 从开发框架升级为独立产品层」的标志性动作——卖的不是模型，而是承载长期任务的运行时基础设施。
- 配合 GPT-6 Astra 与 Responses API 的异步工具调用、中途转向、推理强度切换、失配监控等原语，多步编码任务的工具调用与恢复能力被实质性强化。
- 启示：评估 AI 编程工具时，应关注「增量规划 / 证据回传 / 验收分离」三能力，而非只看模型跑分。

### 2. Google 开源 Mantis：让编码智能体自动找漏洞、复现并打补丁
**事件内容**：Google 开源 Mantis 漏洞审查技能包（协议无关），可自动完成「发现缺陷 → 过滤误报 → 沙箱复现 → 写最小补丁 → 对补丁再攻击并给出 1-10 风险评分」的闭环。

**核心要点**：
- 将「安全左移」交给 Agent，是编码智能体从「写功能」迈向「守安全」的标志性开源项目。
- 把安全审查从人工流程固化为可复用、可审计的技能包，对 CI/CD 与供应链安全有直接落地价值。

### 3. 清华 × Qwen 团队 Terminal-Universe：把 Agent 轨迹重构为可复用训练环境
**事件内容**：清华与 Qwen 团队提出 Terminal-Universe，从既有 Agent 轨迹还原可验证的代码工作区，自动生成海量新训练任务；微调 Qwen3.5-27B 后，Terminal-Bench 2.1 准确率由 46.2% 提升至 58.1%。

**核心要点**：
- 给出「轨迹即数据」的可复制范式：把线上运行产生的真实轨迹转化为训练信号，避免为编码模型专门构造数据的高成本。
- 对自研编码模型、构建内部编码智能体训练闭环有较高参考价值。

### 4. GitHub HydraFusion：多模型编排，编码成本下降 36-67%
**事件内容**：9 月 4 日，GitHub 在 Copilot CLI 中推出 HydraFusion 研究预览，按任务动态编排多个模型——Single（单模型执行）、Cascade（廉价模型先试，质量不足再升级）、Critique（一写一审一改）。在 TerminalBench 2.1、DeepSWE、CheckpointBench 上达到与 Claude Opus 5 相当或更优的结果，而 token 成本估计降低 36-67%。

**核心要点**：
- 「智能组合多模型」成为降本主流路径，行业焦点从单模型跑分转向「编排策略 + 成本治理」。
- 通过 /experimental 命令即可调用，无额外收费，降低了生产化尝试门槛。

### 5. Cursor 发布 Projects：协调跨周、跨子 Agent 的长期工作
**事件内容**：9 月 10 日，Cursor 推出 Projects——一个协调器 Agent，将大型工作（功能构建、迁移、新应用）拆解为子任务并行委派给子 Agent；共享上下文跨 Agent 同步，关闭笔记本后仍在云端运行，可订阅 Slack 频道、跟踪 PR、按日程执行。

**核心要点**：
- 编码 Agent 从「单次会话」走向「跨周持续运行」，叠加此前自托管机器（9/2）与 Start From Scratch（8/27），明确押注「更长、更少监督、更可控基础设施」的方向。
- 长期 Agent 的交互界面正从聊天窗口演变为「任务收件箱 + 审批中心」（可暂停、可审批、跨设备恢复）。

### 6. Anthropic Claude Fable 5.1 与 Agent Plugins 标准
**事件内容**：Anthropic 推出 Claude Fable 5.1 / Mythos 5.1（面向长时程编码），并加入托管 Agent 权限策略（自动评估并允许/拒绝/暂停工具调用），生成产物可带 C2PA 内容凭证。与此同时，Agent Plugins（可复用组件扩展 Agent 的标准）获 OpenAI、Microsoft、Cursor、AWS 支持。

**核心要点**：
- 长时程 Agent 的「权限与审批设计」成为竞争焦点，自动拦截危险操作、人工在环暂停成为标配能力。
- 插件标准化有利于生态互通，但 Google、Anthropic 暂未加入，标准阵营仍存分化。

## 二、具身智能方向

### 7. 小鹏 IRON 全球首台高阶通用人形机器人自动化总装并自主走下产线
**事件内容**：9 月 8 日，小鹏机器人自动化产线正式启用，全球首台高阶通用人形机器人 IRON 完成自动化总装并自主走下产线。IRON 全身 76 个自由度（单手 21 个），搭载 3 颗自研图灵 AI 芯片，有效算力 2250 TOPS，端侧部署物理 AI 大模型，核心制程自动化率超 80%。

**核心要点**：
- 标志着小鹏机器人从研发试制跨越到产线制造，迈向规模量产。
- 「汽车级质量体系 + 高自动化率」为后续快速扩产奠定基础，是具身智能「量产元年」的硬证据。

### 8. 宇树 UnifoLM-X2-1.0：世界模型首次实时驱动全自主人形搏击
**事件内容**：9 月 7 日，宇树发布自研世界-动作大模型 UnifoLM-X2-1.0，首次实现人形机器人全自主搏击——出拳、格挡、躲闪及连续攻防转换全程未依赖遥控或预设脚本，由模型实时生成。

**核心要点**：
- 突破世界-动作模型在瞬时规划、决策与动态交互执行上的瓶颈，标志世界模型驱动在动态对抗场景迈入可用门槛。
- 这是宇树 8 月登陆科创板（「人形机器人第一股」）后「大脑」层面的关键补强。

### 9. 智元 AGILE 2.0：灵犀 X2 实现行业首例自主踩球行走
**事件内容**：9 月 9 日，智元发布 AGILE 2.0 感控一体视觉端到端模型，整合环境感知、地形理解、全身运动控制与操作；搭载该模型的灵犀 X2 完成钻火圈、踩球行走、三人跳长绳等高难度任务，其中「踩球行走」为双足人形机器人首次自主实现。

**核心要点**：
- 从「预设脚本」走向「睁眼运动」，双足人形运动智能达到新高度，可适配动态扰动与多机协同。
- 视觉端到端感控一体降低了对外置状态估计的依赖，利于真实场景泛化。

### 10. 京东开源 JoyAI-EchoWM：可交互视听世界模型，WBench Navigation 综合第一
**事件内容**：9 月 9 日 JDD 大会上，京东探索研究院发布并开源 JoyAI-EchoWM，原生联合生成 720P 视频 + 环境音 + 音乐 + 语音，支持第一/第三人称切换与多轮连续探索。在 WBench Navigation 158 案例中以 81.7 综合分位列第一（一致性 89.8、交互性 87.2），同步开源论文与权重。

**核心要点**：
- 为沉浸式内容创作与具身智能仿真训练提供新的世界模拟能力，可直接用作机器人训练的环境引擎。
- 「视听可交互世界模型」与宇树、智元的运动智能形成互补——前者造环境，后者练动作。

## 三、趋势小结

- **AI Coding 收敛于「运行时基础设施」**：Harness 正从脚手架独立为分层（Session/Context/Tool/Subagent/Memory/Eval/Policy 统一管理），竞争变量从「模型更强」转向「长期、可靠、可验证地跑下去」。
- **具身智能进入「工程闭环跑通」阶段**：技术竞争已从「模型能不能训出来」转向「世界模型 + 感控一体 + 量产产线」能否闭环，2026 下半年真实交付与下产线成为最强信号。
- **共性关键词**：长时程、可验证、降本（36-67%）、安全左移、插件/协议标准化。

---

*数据来源：OpenAI 官方、MarkTechPost、GitHub、Cursor、Anthropic、清华/Qwen、小鹏汽车、宇树科技、智元机器人、京东探索研究院、央视网、科技日报等公开报道。*

