目录

AI 热点日报:编程智能体渗透率破 85%,人形机器人量产迈入 5000 台门槛

今日主线:AI 编程从「辅助补全」走向「全流程执行」与「工程化规模交付」,而具身智能则在同一周集体跨过量产与商用的硬门槛。两条线都指向同一个结论——AI 正从「会说话」进入「能交付、能动手」的阶段。

一、AI Coding 方向

1. JetBrains 发布 Mellum 2.1 编程模型,强化智能体编程

2026-10-09,JetBrains 上线编程专用模型 Mellum 2.1,延续 12B 混合专家架构(2.5B 活跃参数),继续采用 Apache 2.0 许可。核心升级是将强化学习从「训练收尾」扩展为「训练主体」,并在数学、算法竞赛、工具调用与软件工程等任务上补充数据;训练期间启动了数百万个沙盒环境。官方称最大改进出现在智能体编程领域:模型可探索代码库、识别失败测试根因、起草修复方案并自行验证结果。对比 Mellum 2、Qwen3.5-9B、Gemma4,其推理吞吐在高负载下接近 Qwen3.5-9B 的两倍,单请求响应速度提升约 1.6 倍。模型已登陆 HuggingFace,后续将提供 llama.cpp/Ollama/LMStudio 的 GGUF 与 vLLM 推测解码组件。

2. 谷歌开放 Gemini 4 Argon 端到端代码工程能力

据 10-09 行业快讯,谷歌正式开放 Gemini 4 Argon 旗舰模型的端到端代码工程能力:该模型可自主理解需求、生成完整代码库、运行测试并直接提交 Pull Request,全程仅需少量人工审核。谷歌内部已用其完成数十万行内核代码迁移,数据显示可覆盖工程师约 40% 的日常编码任务,代码通过率与人工水平相当。这标志着 AI 对编程的渗透从「补全辅助」升级为「全流程执行」,将深刻改变软件研发工作模式。

3. Harness 收购 Augment Code 资产,推出 Cosmos 软件工厂智能体

2026-10-08,软件交付厂商 Harness 宣布收购 Augment Code 的部分资产,包括 Cosmos、Auggie CLI、Code Context Engine 及相关技术,原团队加入 Harness。Cosmos 被改造为「Harness Cosmos Software Factory Agent」:一支 agent 舰队可规划改动、编写代码与测试、开 PR,每个 agent 运行在独立隔离 VM 中,关键决策(如批准设计、最终合并)仍由工程师介入。Harness 还计划把 Code Context Engine 接驳到其「软件交付知识图谱」,让 agent 调用历史测试失败、安全发现与事故记录。CEO Jyoti Bansal 强调:AI 对软件的影响「不取决于生成多少代码,而取决于有多少有价值的软件到达客户手中」。

4. AI 编程 Agent 渗透率突破 85%,验证与发布成新瓶颈

钛媒体援引 JetBrains 报告(2026-10-03)显示,全球约 90% 专业开发者每周使用 AI 编程 Agent,AI 工具整体渗透率已达 85%。Anthropic 数据称工程师合并代码请求量提升 67%、70%–90% 代码在 AI 辅助下完成;快手自研 AI Agent 员工使用占比超 92%,AI 生成代码贡献率 60%;OpenAI 内部已有超百万行代码系统实现零人工手写。行业共识是:「AI 造 AI」三层递进加速,腾讯超 50% 新增代码由 AI 辅助完成,验证与发布环节成为新的效率瓶颈。

5. Claude Code 在 Terminal-Bench 4.0 领跑 64.8%,智能体编程进入「分工时代」

10-07 发布的 Automated Benchmark Arena 报告显示,Claude Code + Opus 5.5 以 64.8% 成功率登顶 Terminal-Bench 4.0,领先 Codex + GPT-6.1 Sol(58.2%)。但社区共识已从「谁最强」转向「按工作流选型」:Cursor 擅长多文件重构(IDE 集成深),Copilot 在企业低摩擦补全上占优,Claude Code 强在自主执行。开发者开始采用多工具栈组合(如 Cursor 做架构重构、Claude Code 走 CLI 自主实现、Copilot 做行内修复),「单一通吃」时代落幕。

6. Hugging Face TRL v1.15.0 默认 fused LM head,同 GPU 训练序列最长 6.9× 提升

2026-10-08,Hugging Face 发布 TRL 1.15.0,将 fused LM head 设为训练器默认项,避免训练时构建超大全连接表。官方测试(单卡 NVIDIA B300,79GiB 显存,小模型 gemma-3-1b):DPO 可训练序列从 10,240 提升到 59,392 tokens(5.80×),KTO 从 9,216 提升到 63,488(6.89×);在 8,192 tokens 下峰值显存下降 52%–82%、单步提速 2.3%–10.9%。该收益对小模型 + 大词表场景最显著,为本地与边缘侧的智能体微调降低门槛。

二、具身智能方向

7. Agility Robotics 第 5000 台 Digit 下线,部署 200+ 客户现场

据 10-10 行业里程碑披露,Agility Robotics 第 5000 台 Digit 人形机器人正式下线,已在物流与零售等 200+ 客户现场部署,运营时长累计超 6.5 万小时;Digit 5(9 月发布)定位为「可与人协作安全共事」的首款人形机型。亚马逊已将 Digit 扩展到北美 20 个履约中心做货到人作业,吞吐较上一代自动化方案提升约 30%。人形机器人从 Demo 走向「可计数、可部署」的硬指标阶段。

8. 宇树 G2 Pro 量产 5000 台,中国制造成本与规模优势凸显

宇树(Unitree)在 10 月宣布 G2 Pro 人形机器人量产达到 5000 台,部署于国内制造与物流场景。叠加其早前发布的 Dex5-S 灵巧手(22 自由度、可反向驱动关节、人类手尺度定价约 6500 美元起),宇树以「低成本 + 高量产」路线巩固了全球人形机器人量产第一梯队的位置,也体现了中国供应链在整机成本与交付节奏上的优势。

9. Figure AI 完成超 10 亿美元 C 轮(估值 390 亿美元),BotQ 工厂每 60 分钟下线一台

Figure AI 的 C 轮融资金额超 10 亿美元,投后估值约 390 亿美元(较 2024 年 B 轮约 26 亿美元涨约 15 倍),由 Parkway Venture Capital 领投,NVIDIA、Intel Capital、Salesforce、Qualcomm Ventures、T-Mobile Ventures 等跟投。更具商业价值的是 Figure 03 已部署到宝马斯帕坦堡工厂做物流分拣;其 BotQ 工厂目标年产能 1.2 万台、约每 60 分钟下线一台。NVIDIA 既是投资人也是 GPU 供应商,绑定其 Helix 模型的训练集群,形成「机器人 + 算力 + 产业方」的纵向生态。

10. 智元(AgiBot)第 2 万台机器人下线,长隆落地 300+ 台

据 10-03 报道,智元第 2 万台机器人下线并交付长隆,累计在珠海长隆飞船乐园部署 300+ 台,覆盖表演、游客引导与酒店服务,并共建旅游研究院。IDC 估算 2026 上半年全球人形机器人出货近 2.5 万台、智元以约 35% 份额领先。与此同时,业内也开始「理性看待具身智能泡沫」:2026 上半年赛道融资超 900 亿元,但多数人形企业营收小、持续亏损、依赖融资,家庭场景大规模商业化仍距 5–10 年,资本正向「有真实订单、能落地」的工业/特种场景回摆。

三、小结

编程侧,模型与工具正把 AI 从「写代码」推向「审代码、交代码、管代码」的工程闭环,但验证与发布成为新瓶颈;具身侧,量产数字(5000 台、第 2 万台、每 60 分钟一台)开始替代 PPT Demo 成为硬指标,资本也从「讲故事」转向「看订单」。两条线共同指向:AI 价值的兑现,正从模型能力转向「可交付、可落地」的工程与产业能力。


来源:JetBrains 官方、谷歌云/行业快讯、Harness/TNS Media、钛媒体、Crew.ai 信号周报、Hugging Face、Agility Robotics、宇树、Figure AI、智元/Humanoids Daily、中国经济时报等公开报道整理。