目录

AI热点日报:Agents API公测、多模型编排降本、中国人形机器人占全球97%

每日 AI 热点精选 · 2026-09-13 · 聚焦 AI Coding具身智能 两大主线。 本期从编程智能体工程化、多模型成本革命、代码能力评测,到人形机器人量产格局与落地现实,梳理 10 条最具参考价值的信息。


一、AI Coding:编程智能体进入工程化与降本周期

1. OpenAI Agents API 进入公开测试,Codex 编排能力托管化

9 月 10 日,OpenAI 将 Codex 编排引擎封装为托管 API 对外公测。它提供持久会话、自动上下文压缩、MCP 工具接入、并行子智能体(subagents),以及 OpenAI / Cloudflare / Daytona / E2B / Modal / Vercel 等托管执行环境

核心影响:对 TypeScript/Node.js 与 Python 团队而言,Agent 平台的脚手架工作量大幅下降;代价是 Agent 循环行为、上下文持久化、沙箱成本与编排逻辑开始变成「生产依赖」。这是编程智能体从「开发者玩具」走向「基础设施」的标志性一步。

2. Cursor 升级为「自托管 Agent 云平台」,被断供后反向构筑护城河

9 月 4–11 日,Cursor 一口气推出约 15 项更新,核心是 Origin 原生代码托管Cloud Agents 自托管。Origin 支持双向 GitHub 同步、PR 工具、Vercel/Buildkite 预览与流水线;Cloud Agents 可订阅 PR/Slack 事件,用 /goal 跑长目标,从零建项目直接存 Origin 仓库并一键发布;自托管机器支持团队动态池、休眠、Linux/Mac computer use,密钥留内网。

核心影响:在被 OpenAI 断供模型后,Cursor 没有退守「AI 编辑器」,而是把开发工作流(托管/CI/预览/发布)闭环收进自家产品,升级为「自托管 Agent 云平台」——这是工具商被上游模型商「卡脖子」后的典型护城河自救。

3. Claude Code 工程化:plugin eval 上线、并发上限拉到 256;Codex 桌面端接 Ollama

9 月 11 日前后,Claude Code 连续更新(v2.1.269 等):claude plugin eval 让插件/skill 作者写测试用例、打分、关插件重跑看 delta;/output-style 可切换(含 Remote Control、headless 云会话);从 Bash 改的文件直接出 diff;CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(1–256)拉高 workflow 并发。同期 Codex 桌面端已能对接 Ollama 本地模型,offline open-weights 编码循环成型。

核心影响:编程智能体从「能跑」进入「可测试、可评测、可规模化并发」的工程化阶段;本地权重打通意味着企业数据不出域的私有化编码方案成为可行路径。

4. 微软开源 FastContext:小模型当「代码侦察兵」,Token 消耗降 60%

9 月上旬,微软提出并开源 FastContext,将编程 Agent 中「找代码」的环节从主模型推理中剥离,交给专用小模型(4B–30B)完成。该小模型用只读工具并行检索并压缩上下文,主模型只接收精炼结果。

关键数据:接入 Mini-SWE-Agent 评测,端到端解决率最高提升 5.5%,主模型 Token 消耗最多降低 60%。这代表「主模型 + 多专用 Agent 协作」路线,与 GitHub 热榜上 superpowers、ECC 等项目同向,正取代「单模型巨无霸」成为 Agent 工程新范式。

5. GitHub HydraFusion:多模型动态编排,成本降 36–67%

9 月 4 日,GitHub Project HydraFusion 作为研究预览登陆 Copilot CLI。它根据任务动态编排多个模型,支持三种执行模式:Single(单模型)、Cascade(便宜模型先试,质量不足再升级)、Critique(一个写、一个审、再修订)。

关键数据:在 TerminalBench 2.1、DeepSWE、CheckpointBench 上达到或超过 Claude Opus 5,同时估算 Token 成本降低 36%–67%。用户通过 /experimental 命令调用,无额外收费。多模型组合正成为「降本不降质」的主流解法。

6. 中国信通院升级发布方升-Code 2.0,代码能力评测有了新标准

9 月 11 日,中国信通院在服贸会升级发布 方升-Code 2.0 大模型基准测试体系。随着大模型走向代码生成、智能体协作等产业场景,代码能力的标准化评估需求凸显。新体系为开发者选型和企业落地提供可比较参考。同期,AWS 发布教程演示如何用 Amazon Bedrock AgentCore 构建交互式 MCP 应用,将服务以富组件形式呈现在 ChatGPT、Claude 等 AI 宿主内,降低接入对话式 AI 的门槛。


二、具身智能:量产格局初定,落地进入「挤泡沫」阶段

7. 中国人形机器人出口 + 制造占全球 97%

9 月 9 日,在聚合智能产业发展大会上,权威人士援引最新数据:中国人形机器人的出口和制造占全球比例已达 97%。2025 年全球通用人形机器人出货量约 1.8 万台(同比 +508%),2026 年中国国内预计出货 6.25 万台;宇树、智元、乐聚、加速进化、优必选五家中国企业合计占全球整机出货量 74%

判断:2025–2026 是「量产元年」,2027–2028 进入规模化渗透。短板仍在高端 RV 减速器、触觉电子皮肤、力觉传感器、具身专用算力芯片与底层仿真生态。

8. 外滩大会具身智能论坛:模型 / 数据 / 生态突围,但「真干活」成功率仅 5%–10%

9 月 11 日,2026 Inclusion·外滩大会举行具身智能主题论坛,多位科学家与百亿级企业负责人围绕通用大脑、数据飞轮与场景落地展开讨论,将模型—数据—生态协同视为突围关键。但同一时期的一组数字泼了冷水:外滩大会现场超 40 家厂商展示,机器人能在药房分拣等场景「真干活」,只有 5%–10% 的任务达到接近 100% 成功率

核心观点:产业方向未被否定,被否定的是时间表。比拼焦点正从「能展示多少动作」转向「把某几个具体任务成功率从 80% 推到接近 100%」。

9. 蚂蚁灵波开源三款 LingBot-World 2.0 世界模型,启动 15 亿首轮融资

外滩大会上,蚂蚁集团全资子公司蚂蚁灵波开源三款 LingBot-World 2.0 机器人大脑模型,并启动首轮融资拟募资 15 亿元用于人才激励。其通用大脑已在国大药房等场景落地,无需改造原有货架;同步启动基于 LingBot-VLA 2.0 的具身大模型挑战赛,联合生态伙伴推动从「单次任务成功」走向「低成本、可复制的规模化应用」。

核心观点:具身智能的核心壁垒是高质量真实物理数据,大模型仅为工具。开源模型 + 资本投入正加速生态建设。

10. 服贸会具身全产业链首秀:电子架构底座 + 150 万小时人类行为数据库

9 月 12 日,服贸会 3 号馆汇聚 130 多家企业,集中展现具身智能全产业链。亮点包括:我国自主研发的机器人电子架构底座技术首秀(一套架构覆盖日常、工业、医疗等多场景);以及一套可穿戴数据采集设备,将抓、拿、递等行为转化为机器人「教材」,已形成超过 150 万小时的人类行为数据库;配套仿真训练系统可高度还原物理真实场景,降低中小企业训练成本。

核心影响:具身智能各产业链的首发首秀正走向更加精细化的落地场景,数据基础设施成为产业扩张的支点。


小结

  • AI Coding 主线:编程智能体正从「能写代码」跨入「可托管、可评测、可并发、可降本」的工程化阶段。OpenAI Agents API、Cursor 自托管云平台、Claude Code plugin eval 是平台化信号;微软 FastContext 与 GitHub HydraFusion 则指明「多模型协作 + 小模型分流」的降本路径。
  • 具身智能主线:中国已占据全球 97% 的制造与出口份额,但「真干活」成功率仅 5%–10% 的现实提醒行业进入挤泡沫期。从外滩大会到服贸会,焦点正从 Demo 炫技转向数据飞轮、世界模型与规模化落地的硬指标。

资料来源:O’Reilly Radar、Zinbiel Daily AI Engineering Brief、腾讯新闻、央视网、盖世汽车、网易、36氪、第一财经等公开报道。