---
title: "LLM-PRISM: Characterizing Silent Data Corruption from Permanent GPU Faults in LLM Training"
title_zh: "LLM-PRISM：大模型训练中永久GPU故障引发的静默数据损坏特征分析"
arxiv_id: "2604.10390"
paper_type: "analysis"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.10390.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LLM-PRISM：大模型训练中永久GPU故障引发的静默数据损坏特征分析

## 一句话定位

提出LLM-PRISM方法，结合RTL级GPU故障模拟与Megatron-LM中的随机注入引擎，系统评估永久性和间歇性硬件故障对LLM预训练的影响，发现数值格式（FP8 > BF16 > FP16）和故障相位显著影响训练稳定性。

## 小学生也能听懂

这篇论文像给大模型做“体检”，用电脑模拟GPU坏了会怎样，发现不同数字格式（FP8最稳，BF16最弱）和出错时机严重影响训练，即使没报错，模型也可能悄悄变差。

## 为什么值得记录

- 首次从硬件层面出发，对LLM预训练过程中由永久性和间歇性GPU故障引起的静默数据损坏（SDC）进行系统性表征
- 揭示了传统损失曲线无法反映的权重漂移和隐性退化问题，挑战了‘LLM训练天然容错’的直觉
- 量化了不同数值格式（FP16/BF16/FP8）在抗SDC方面的显著差异，为硬件-算法协同设计提供依据
- 评估了广泛使用的NaN/Inf检测机制的有效性，发现其在BF16下虽能减少崩溃但无法阻止高达400%的PPL退化

## 核心方法

- 构建七元组故障站点模型（rank, layer, training phase, fault checkpoint, error rate, fault density, bit-flip profile），涵盖空间、时间、架构和位级维度
- 基于RTL仿真提取6000+真实GPU功能单元（如Tensor Core、FMA、L1缓存）的硬件错误签名，避免理想化随机位翻转假设
- 在Megatron-LM中实现软件级故障注入框架，支持在正向激活、反向输入梯度、反向权重梯度三个阶段注入错误
- 采用伯努利过程建模间歇性故障激活，通过调节error rate参数（0~1）统一描述永久性与间歇性故障行为
- 控制变量实验设计：固定模型架构（GPT-2 Small/Medium）和数据集（WikiText），仅变化数值格式以隔离精度影响

## 关键结果

- 识别出四种典型故障模式：Spike-and-Recover（尖峰恢复）、Spike-and-Degrade（尖峰退化）、Silent Degradation（静默退化）、Gradual Drift（渐进漂移），其中后两者无NaN事件但导致最终PPL上升
- FP8表现出最强鲁棒性：故障结果呈二元分布（吸收或发散），无静默退化；BF16最脆弱：高崩溃率+高达400%的PPL退化；FP16居中但退化持续存在
- 故障相位是关键预测因子：前向输出和反向输入梯度故障导致约60%崩溃率，而反向权重梯度故障多可自纠正
- NaN检查可将致命轨迹转为Spike-and-Recover，但在BF16中关闭该机制会使失败率上升并暴露隐性质量损失
- 权重L2范数差异显示所有故障率下参数均单调偏离基线，说明即使‘成功’收敛的模型也存在结构性偏差

## 局限与风险

- 实验基于较小规模模型（124M/355M参数），可能无法完全反映千亿级生产模型的故障传播特性
- 依赖RTL故障模型的准确性，若实际硅缺陷行为与仿真签名不符，则结论有效性受限
- 仅测试序列并行配置，未涵盖流水线/张量并行等不同分布式策略对SDC传播的影响

## 适合沉淀的概念

`silent-data-corruption`, `permanent-gpu-faults`, `fault-injection-methodology`, `numerical-format-resilience`, `llm-training-stability`, `rtl-to-software-fault-mapping`, `intermittent-fault-modeling`, `nan-detection-effectiveness`

## 阅读注意

- 重点关注图5展示的四种故障模式及其对应的权重发散曲线，理解‘损失正常但模型已坏’的现象
- 注意表I对比：本文是首个支持分布式训练、覆盖完整预训练周期、使用硬件真实故障模型的研究
- 图3的RTL错误签名示例揭示了不同硬件模块（Tensor Core vs Cache）导致的结构化位翻转模式差异
- 第V-C节关于BF16‘双重风险’（高崩溃+高退化）的讨论对实际系统选型具有重要警示意义

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.10390.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、结果分析与局限讨论，数据充分（7664次训练运行），逻辑清晰，可复现性强。
