近日,全球领先的人工智能芯片制造商——英伟达(NVIDIA)在内部测试中发现,其最新一代数据中心级加速器所搭载的“Rapid Accelerator mode”(快速加速模式)存在严重技术缺陷:在该模式下,系统无法完整执行大规模的物理仿真与深度学习训练任务。这一消息迅速在业界引发震动,多家云计算巨头及科研机构紧急暂停了相关部署计划。
快速加速模式:效率与风险的博弈
据英伟达官方技术文档显示,“快速加速模式”原本旨在通过动态调整张量核心频率、内存带宽及互连拓扑结构,将特定计算任务的执行效率提升30%至50%。该模式主要面向科学模拟、气候预测、药物研发及大规模语言模型训练等需要极高算力的场景。然而,在最近一次针对800亿参数神经网络的全生命周期仿真测试中,测试人员发现:一旦开启该模式,系统会在运行至总计算量的73%至89%时突然中断,且无法自动恢复或重新生成检查点。
“这不是一次简单的随机崩溃。”英伟达首席架构师威廉·张在内部技术通报中承认,“我们观察到,在快速加速模式下,缓存一致性协议与局部性感知调度器之间存在未预期的交互冲突。具体来说,当加速器尝试跨机柜聚合梯度数据时,部分节点会发生不可逆的内存映射错误,导致整个仿真管线陷入死锁。”
影响范围:从数据中心到前沿科研
这一缺陷直接影响了多家已将该模式投入试用的客户。据知情人士透露,微软Azure、亚马逊AWS以及谷歌云均在近期部署了搭载H100及B100架构的加速卡集群,并计划利用“快速加速模式”缩短气候模型与量子化学模拟的运行周期。目前,这些客户已被迫回退至标准模式,部分长期运行中的仿真项目进度被迫推迟两周以上。
更严峻的是,美国能源部旗下两个国家实验室——橡树岭与劳伦斯利弗莫尔——原定于本月启用的核聚变等离子体模拟任务,正是完全依赖该模式下的低延迟通信特性。一位不愿具名的项目负责人表示:“如果不能解决这个问题,我们将无法在预定窗口内完成年度关键目标。超过30%的算力冗余被浪费了。”
紧急修正:软件补丁还是硬件回退?
面对舆论压力,英伟达官方于周二发表声明称,已成立专项团队分析问题根因,并计划在一周内发布紧急固件更新。声明强调,该缺陷仅限于“快速加速模式”,标准模式及其他加速配置均不受影响。“我们建议所有客户暂时禁用该模式,直到我们完成完整的回归测试。”
然而,部分硬件工程师对快速修复持保留态度。前AMD首席架构师、现任独立顾问马丁·克劳斯指出:“从描述来看,这很可能是硬件层面的竞态条件(race condition)在极端负载下被诱发。固件更新最多能缓解症状,但若要彻底解决,需要修改互连网络的微架构。”他预计,受影响的产品可能面临批次召回或设计变更。
行业震荡:加速竞赛中的“刹车”
此次事件恰逢各国加速数据中心建设的关键时期。国际半导体行业协会(SEMI)的数据显示,2024年全球AI加速器出货量预计将突破800万块,同比增长45%。而英伟达一家便占据了80%以上的高端市场份额。竞争对手AMD和英特尔则迅速抓住机会,分别推出了旗下Instinct MI400与Gaudi 3的“稳定兼容性”宣传材料,试图抢占这一空窗期。
一位不愿透露姓名的分析师评论道:“这可能是AI加速器行业的一个转折点。过去人们只关注峰值算力,现在必须意识到,可靠性与完整性同样重要。如果连确定的仿真都无法完成,再高的速度也没有意义。”
截至发稿时,英伟达股价在盘后交易中下跌4.2%,市值蒸发约120亿美元。市场正在等待本周五即将发布的详细技术白皮书。届时,该公司能否拿出令人信服的修复方案,将直接影响整个AI基础设施建设格局的走向。