论文
arXiv2604.10390
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级79 分钟

2604.10390

论文导读

提出LLM-PRISM方法,结合RTL级GPU故障模拟与Megatron-LM中的随机注入引擎,系统评估永久性和间歇性硬件故障对LLM预训练的影响,发现数值格式(FP8 > BF16 > FP16)和故障相位显著影响训练稳定性。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

LLM-PRISM:大模型训练中永久GPU故障引发的静默数据损坏特征分析

一句话定位

提出LLM-PRISM方法,结合RTL级GPU故障模拟与Megatron-LM中的随机注入引擎,系统评估永久性和间歇性硬件故障对LLM预训练的影响,发现数值格式(FP8 > BF16 > FP16)和故障相位显著影响训练稳定性。

小学生也能听懂

这篇论文像给大模型做“体检”,用电脑模拟GPU坏了会怎样,发现不同数字格式(FP8最稳,BF16最弱)和出错时机严重影响训练,即使没报错,模型也可能悄悄变差。

为什么值得记录

  • 首次从硬件层面出发,对LLM预训练过程中由永久性和间歇性GPU故障引起的静默数据损坏(SDC)进行系统性表征
  • 揭示了传统损失曲线无法反映的权重漂移和隐性退化问题,挑战了‘LLM训练天然容错’的直觉
  • 量化了不同数值格式(FP16/BF16/FP8)在抗SDC方面的显著差异,为硬件-算法协同设计提供依据
  • 评估了广泛使用的NaN/Inf检测机制的有效性,发现其在BF16下虽能减少崩溃但无法阻止高达400%的PPL退化

核心方法

  • 构建七元组故障站点模型(rank, layer, training phase, fault checkpoint, error rate, fault density, bit-flip profile),涵盖空间、时间、架构和位级维度
  • 基于RTL仿真提取6000+真实GPU功能单元(如Tensor Core、FMA、L1缓存)的硬件错误签名,避免理想化随机位翻转假设
  • 在Megatron-LM中实现软件级故障注入框架,支持在正向激活、反向输入梯度、反向权重梯度三个阶段注入错误
  • 采用伯努利过程建模间歇性故障激活,通过调节error rate参数(0~1)统一描述永久性与间歇性故障行为
  • 控制变量实验设计:固定模型架构(GPT-2 Small/Medium)和数据集(WikiText),仅变化数值格式以隔离精度影响

关键结果

  • 识别出四种典型故障模式:Spike-and-Recover(尖峰恢复)、Spike-and-Degrade(尖峰退化)、Silent Degradation(静默退化)、Gradual Drift(渐进漂移),其中后两者无NaN事件但导致最终PPL上升
  • FP8表现出最强鲁棒性:故障结果呈二元分布(吸收或发散),无静默退化;BF16最脆弱:高崩溃率+高达400%的PPL退化;FP16居中但退化持续存在
  • 故障相位是关键预测因子:前向输出和反向输入梯度故障导致约60%崩溃率,而反向权重梯度故障多可自纠正
  • NaN检查可将致命轨迹转为Spike-and-Recover,但在BF16中关闭该机制会使失败率上升并暴露隐性质量损失
  • 权重L2范数差异显示所有故障率下参数均单调偏离基线,说明即使‘成功’收敛的模型也存在结构性偏差

局限与风险

  • 实验基于较小规模模型(124M/355M参数),可能无法完全反映千亿级生产模型的故障传播特性
  • 依赖RTL故障模型的准确性,若实际硅缺陷行为与仿真签名不符,则结论有效性受限
  • 仅测试序列并行配置,未涵盖流水线/张量并行等不同分布式策略对SDC传播的影响

适合沉淀的概念

silent-data-corruption, permanent-gpu-faults, fault-injection-methodology, numerical-format-resilience, llm-training-stability, rtl-to-software-fault-mapping, intermittent-fault-modeling, nan-detection-effectiveness

阅读注意

  • 重点关注图5展示的四种故障模式及其对应的权重发散曲线,理解‘损失正常但模型已坏’的现象
  • 注意表I对比:本文是首个支持分布式训练、覆盖完整预训练周期、使用硬件真实故障模型的研究
  • 图3的RTL错误签名示例揭示了不同硬件模块(Tensor Core vs Cache)导致的结构化位翻转模式差异
  • 第V-C节关于BF16‘双重风险’(高崩溃+高退化)的讨论对实际系统选型具有重要警示意义

质量说明

  • 采用来源:cleanpapers/2026/04/2604.10390.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、结果分析与局限讨论,数据充分(7664次训练运行),逻辑清晰,可复现性强。