PAPERS READER · 大模型论文阅读地图 · 开源版 v0.1

大模型论文 阅读地图

26 篇已发布 · 每天 1 篇更新 · 5 标签分类 · 3 类读者推荐路径 · 中英双语全文翻译 · 公式 KaTeX · 图含中文图注
🔧 数据工程
4
🏗️ CPT
3
🎯 后训练
9
📊 技术报告
10
🌐 其他
1
🛠️ 算法工程师
在职 · 4-6 周 · 目标:跟 SOTA + 工程落地
你已经懂 Transformer 和 RLHF 基础,想搞清楚最新一代怎么做、为什么这么做、能不能复用到自己的业务。重点路径:完整 pipeline → 数据工程 → 后训练前沿。
🎓 冲击算法岗学生
求职 · 3 周 · 目标:面试讲清训练全栈
你需要在面试时把 RLHF→DPO→GRPO 的演进、数据 pipeline、Scaling Law 一气呵成讲完。重点路径:经典论文背公式 + 一份完整工业报告。
👨‍🏫 大模型方向老师
授课 · 学期 5 模块 · 目标:横向对比 + 演进脉络
你要给研究生开课,需要每个主题有 2-4 篇代表作,能讲清楚"前作 → 改进 → 现状"。重点路径:每个 tag 都按时间线选 3-4 篇,横向对比技术报告。
标签: 读者: 优先级:
🔧 数据工程 4 篇 收集 / 清洗 / 去重 / 配比 / 合成数据 — 工业训练的真正瓶颈
数据工程 deep AI2 · 3T tokens
开源完整 pipeline + 工具链 + 决策记录,工业数据工程的教科书。
数据工程 deep HuggingFace · 15T
质量过滤消融最透;FineWeb-Edu 把"教材级"概念量化,2024 后训练数据范式。
数据工程 read 数据 Benchmark
把"数据选择"做成 benchmark,统一对比不同过滤策略的实验框架。
数据工程 read 数据配比
把"调配比"自动化的奠基论文。Group-DRO 思路用代理模型搜最优 domain weights。
🏗️ CPT · 继续预训练 3 篇 领域适配 / 能力增强 / Scaling 理论 — base 模型上长出新能力
CPT read DAPT / TAPT
CPT 概念的鼻祖,提出 DAPT(领域)/ TAPT(任务)两套范式,面试常问。
CPT read LR 调度
CPT 学习率重启策略 + replay 比例。工业训练落地必读,灾难性遗忘缓解方案。
CPT 其他 skim 20 tokens / param
推翻 Kaplan,现行 compute-optimal 标准(D ≈ 20×N)。70B 时代的依据。
🎯 后训练 9 篇 SFT / RLHF / DPO / GRPO / RLVR / 蒸馏 — base 模型变 chat / reasoning 的关键
后训练 skim RLHF 经典
RLHF 三阶段流水线奠基。所有后训练论文的"前作",面试必背三阶段画图。
后训练 deep DPO
用 BT 模型 + KL 等价性,把 RLHF 退化成监督式分类。损失函数必默写。
后训练 deep 无 ref model
DPO 的 reference-free 简化版,长度归一化 + 目标 margin γ。小算力首选 baseline。
后训练 read 非成对数据
用前景理论解释损失厌恶,需要"好/坏"二元标签而非成对偏好。冷启动友好。
后训练 read Ψ-PO 理论
指出 BT 在 deterministic 偏好下 reward 发散 → DPO 过拟合,提 squared loss 修正。写论文必引。
后训练 deep GRPO
GRPO 原论文:去掉 critic 用 group baseline,省一半显存,成为 2024-2025 RL 后训练事实标准。
后训练 read 字节 · GRPO++
字节工程版 GRPO:Clip-Higher + Dynamic Sampling + Token-Level Loss + Overlong Reward Shaping。
后训练 deep 反向 KL
把 KD 从 forward KL 换成 reverse KL,避免 mode-averaging,LLM 蒸馏的范式转变。
后训练 read Skew KL
Skew-KL 插值 + adaptive off-policy,蒸馏工程效率显著提升。
📊 技术报告 10 篇 头部厂商完整 pipeline — 看行业在解决什么问题、用什么手段
技术报告 deep MoE + MLA + MTP + FP8
2024 年底 SOTA:DeepSeekMoE + MLA 注意力 + MTP 多 token 预测 + FP8 训练。系统工程教科书。
技术报告 deep 阿里 · 18T
CPT 数据章节教科书级。0.5B-72B 全规模,多语言、长上下文、数学/代码专项全覆盖。
技术报告 read Hybrid Thinking
最新一代 · 思考/非思考混合模式 · 36T 预训练 · 后训练四阶段。一份就能讲清现代 pipeline。
技术报告 read 1T MoE · Muon
Muon 优化器大规模训练(面试热点!)+ agentic foundation。
技术报告 后训练 read Long context RL
long context RL + partial rollouts + length penalty。和 R1 同期对标,方法论不同。
技术报告 skim Meta · 92 页
405B dense + 多模态。92 页全方位,只读架构 + 数据 + 后训练四阶段。
技术报告 其他 read 4M context
Lightning Attention 7/8 + softmax 1/8 混合,MoE 456B,4M 上下文。线性注意力工业落地标杆。
技术报告 skim 智谱 · 355B MoE
三阶段 RL 路线,Reasoning + Coding + Agentic 三轴并进。
技术报告 后训练 skim 小米 · 7B
小米首个推理模型 · RL on math/code · 数据合成思路 · 与 R1 对比。
技术报告 skim 01.AI · 数据中心
Yi-6B / 34B,数据 pipeline 写得最细,中文优化方法系统。
🌐 其他 1 篇 Scaling Law 理论 + 长序列架构 — 跨主题的支柱
其他 CPT skim
见 CPT 区。20 tokens / param 现行标准。