从“能跑模型”到“能跑代理”:发现、运维与算力正在重写 AI 工厂
今天的信号不在单一模型发布,而在代理走进生产后暴露出的底层问题:资源如何被找到、事故如何被定位、每瓦算力如何被衡量,以及机器人何时能把演示变成交付。
01代理先要被发现,才谈得上被编排
发生了什么:AWS 发布的 Agentic Resource Discovery(ARD)被定位为开放的代理资源发现规范;配合 AWS Agent Registry,可把代理、MCP 服务器和工具放入集中目录,并在跨云或混合环境中发现它们。与此同时,Databricks 介绍其 AI SRE:在 Kubernetes 集群与多云微服务发生事故时,代理会关联整套栈的信号,协助工程师推进根因调查。
为什么重要:企业里的难题已不只是“给模型接一个工具”。当工具、MCP 服务和代理数量增长,权限边界、版本、归属与可观测性会成为实际的生产约束。开放发现协议解决的是“知道有什么可用资源”,注册表提供本地治理入口;而 AI SRE 指向下一环——资源接入后,系统出错时谁来理解跨服务证据链。
02“每瓦吞吐量”成为代理算力的新口径,网络和 CPU 被重新放到台前
发生了什么:NVIDIA 连续发布面向 agentic AI 工厂的基础设施叙事:Vera CPU 被描述为在单线程性能与并发突发之间取平衡;Spectrum-X Ethernet 针对同步通信、延迟抖动和多租户隔离设计;BlueField-4 则被用于其称为 scale-in 网络的 DPU 加速层。其引用 SemiAnalysis AgentX 基准,以重放生产式 agentic-coding 会话来观察长上下文、工具调用和动态负载,并宣称 Vera Rubin NVL72 相对 GB300 NVL72 的每兆瓦吞吐量提升最高可达 30 倍。
证据该怎么读:上述性能数字来自厂商文章,应视为特定配置和基准下的厂商主张,而不是跨平台的通用结论。但基准的工作负载选择本身很有价值:代理推理并非稳定的单轮生成,而是长序列思考、外部工具调用与短时并发爆发的组合。只测单请求 tokens/s,可能错过排队、网络抖动和 CPU 协调带来的真实体验成本。
原文:NVIDIA:AgentX 与每瓦性能 · NVIDIA:Vera CPU · NVIDIA:Spectrum-X Ethernet · NVIDIA:BlueField-4
03机器人回到交付表:融资、展会与真实场景开始互相校验
发生了什么:TechCrunch 报道称,利用游戏数据训练、面向物理空间通用代理的 General Intuition 正与 Valor Equity Partners、Point72 Ventures 等洽谈融资;报道同时提到该公司此前曾以 23 亿美元估值完成 3.2 亿美元融资。另一边,世界机器人大会的现场观察给出更冷静的参照:工业和 To-B 场景已有常态化运营案例,家庭场景仍多停留在演示;报道也提示要警惕遥控、价格和展示效果之间的落差。
为什么重要:具身智能的叙事常把数据、模型和硬件放在同一条增长曲线上,但商业化要经过更具体的检验:连续运行时的可靠性、部署维护成本、现场数据闭环,以及客户是否愿意为结果而非演示付费。融资代表资本押注,不等于产品成熟;展会人气也不等于单位经济模型成立。
原文:TechCrunch:General Intuition 融资报道 · 36氪:WRC 商业化观察 · 36氪:世界机器人大会现场
高密度快讯
- Marin 535B 开放训练过程。斯坦福 Percy Liang 团队启动 535B 模型训练,公开数据混合、工程配置和实时 loss;报道列出的规模为 18.75 万亿 token、792 颗 GB200、预计三个月。把训练过程暴露给社区,价值不只在模型本身,也在让配置与失误可被复盘。
原文链接 - 小模型推理蒸馏尝试“按需接管”。Relay-OPD 让教师模型在学生推理偏离时短暂介入,来源称其在八个数学推理基准中取得结果,并将训练轨迹长度减半以上;具体效果仍应结合论文设置验证。
原文链接 - ChatGPT Work 的职场代理路线值得关注。TechCrunch 报道称 OpenAI 正构建可访问 Slack、邮件等数字工具的产品,瞄准非工程人员的复杂工作流;权限、隐私和可用性会决定它是否跨过试用阶段。
原文链接 - Hugging Face 收购传闻浮现。TechCrunch 称公司正与银行沟通潜在出售事宜,估值可能在 130 亿美元或以上;这是报道中的潜在交易,尚非已完成交易。
原文链接 - 图学习关注分布外问题。UniGOOD 提出将图的分布外泛化与检测放到统一优化框架中,目标是在协变量和语义偏移同时存在时捕捉不变模式。
原文链接