为什么重要
训练阶段可通过堆叠集群换取时间,线上推理却要同时处理延迟、并发、功耗和单位 Token 成本。Jalapeño 的信息价值不在于单次跑分是否终局领先,而在于 OpenAI 正把“模型提供者”延伸到推理交付栈:若专用硬件确能减少内存与通信开销,竞争将从 CUDA 生态中的通用采购,转向模型、编译/内核和硬件的协同设计。
编辑判断:应把现有数字视为厂商展示与媒体转述,等待独立、可复现实测;但对应用团队而言,已足以提前建立按请求类型分层的成本账本——长上下文、低延迟交互和批量离线任务不应再用同一套硬件假设。
原文:36氪:Jalapeño 实测与 550W · 36氪:N3P 与内存层级 · TechCrunch:Hot Chips 展示