2604.10390
论文导读
提出LLM-PRISM方法,结合RTL级GPU故障模拟与Megatron-LM中的随机注入引擎,系统评估永久性和间歇性硬件故障对LLM预训练的影响,发现数值格式(FP8 > BF16 > FP16)和故障相位显著影响训练稳定性。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
LLM-PRISM:大模型训练中永久GPU故障引发的静默数据损坏特征分析
一句话定位
提出LLM-PRISM方法,结合RTL级GPU故障模拟与Megatron-LM中的随机注入引擎,系统评估永久性和间歇性硬件故障对LLM预训练的影响,发现数值格式(FP8 > BF16 > FP16)和故障相位显著影响训练稳定性。
小学生也能听懂
这篇论文像给大模型做“体检”,用电脑模拟GPU坏了会怎样,发现不同数字格式(FP8最稳,BF16最弱)和出错时机严重影响训练,即使没报错,模型也可能悄悄变差。
为什么值得记录
- 首次从硬件层面出发,对LLM预训练过程中由永久性和间歇性GPU故障引起的静默数据损坏(SDC)进行系统性表征
- 揭示了传统损失曲线无法反映的权重漂移和隐性退化问题,挑战了‘LLM训练天然容错’的直觉
- 量化了不同数值格式(FP16/BF16/FP8)在抗SDC方面的显著差异,为硬件-算法协同设计提供依据
- 评估了广泛使用的NaN/Inf检测机制的有效性,发现其在BF16下虽能减少崩溃但无法阻止高达400%的PPL退化
核心方法
- 构建七元组故障站点模型(rank, layer, training phase, fault checkpoint, error rate, fault density, bit-flip profile),涵盖空间、时间、架构和位级维度
- 基于RTL仿真提取6000+真实GPU功能单元(如Tensor Core、FMA、L1缓存)的硬件错误签名,避免理想化随机位翻转假设
- 在Megatron-LM中实现软件级故障注入框架,支持在正向激活、反向输入梯度、反向权重梯度三个阶段注入错误
- 采用伯努利过程建模间歇性故障激活,通过调节error rate参数(0~1)统一描述永久性与间歇性故障行为
- 控制变量实验设计:固定模型架构(GPT-2 Small/Medium)和数据集(WikiText),仅变化数值格式以隔离精度影响
关键结果
- 识别出四种典型故障模式:Spike-and-Recover(尖峰恢复)、Spike-and-Degrade(尖峰退化)、Silent Degradation(静默退化)、Gradual Drift(渐进漂移),其中后两者无NaN事件但导致最终PPL上升
- FP8表现出最强鲁棒性:故障结果呈二元分布(吸收或发散),无静默退化;BF16最脆弱:高崩溃率+高达400%的PPL退化;FP16居中但退化持续存在
- 故障相位是关键预测因子:前向输出和反向输入梯度故障导致约60%崩溃率,而反向权重梯度故障多可自纠正
- NaN检查可将致命轨迹转为Spike-and-Recover,但在BF16中关闭该机制会使失败率上升并暴露隐性质量损失
- 权重L2范数差异显示所有故障率下参数均单调偏离基线,说明即使‘成功’收敛的模型也存在结构性偏差
局限与风险
- 实验基于较小规模模型(124M/355M参数),可能无法完全反映千亿级生产模型的故障传播特性
- 依赖RTL故障模型的准确性,若实际硅缺陷行为与仿真签名不符,则结论有效性受限
- 仅测试序列并行配置,未涵盖流水线/张量并行等不同分布式策略对SDC传播的影响
适合沉淀的概念
silent-data-corruption, permanent-gpu-faults, fault-injection-methodology, numerical-format-resilience, llm-training-stability, rtl-to-software-fault-mapping, intermittent-fault-modeling, nan-detection-effectiveness
阅读注意
- 重点关注图5展示的四种故障模式及其对应的权重发散曲线,理解‘损失正常但模型已坏’的现象
- 注意表I对比:本文是首个支持分布式训练、覆盖完整预训练周期、使用硬件真实故障模型的研究
- 图3的RTL错误签名示例揭示了不同硬件模块(Tensor Core vs Cache)导致的结构化位翻转模式差异
- 第V-C节关于BF16‘双重风险’(高崩溃+高退化)的讨论对实际系统选型具有重要警示意义
质量说明
- 采用来源:
clean,papers/2026/04/2604.10390.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、结果分析与局限讨论,数据充分(7664次训练运行),逻辑清晰,可复现性强。