工学师
技术报告
deep
MoE + MLA + MTP + FP8
2024 年底 SOTA:DeepSeekMoE + MLA 注意力 + MTP 多 token 预测 + FP8 训练。系统工程教科书。
工学师
技术报告
deep
阿里 · 18T
CPT 数据章节教科书级。0.5B-72B 全规模,多语言、长上下文、数学/代码专项全覆盖。
工师
技术报告
read
Hybrid Thinking
最新一代 · 思考/非思考混合模式 · 36T 预训练 · 后训练四阶段。一份就能讲清现代 pipeline。
工师
技术报告
read
1T MoE · Muon
Muon 优化器大规模训练(面试热点!)+ agentic foundation。
工师
技术报告
后训练
read
Long context RL
long context RL + partial rollouts + length penalty。和 R1 同期对标,方法论不同。
师
技术报告
skim
Meta · 92 页
405B dense + 多模态。92 页全方位,只读架构 + 数据 + 后训练四阶段。
工师
技术报告
其他
read
4M context
Lightning Attention 7/8 + softmax 1/8 混合,MoE 456B,4M 上下文。线性注意力工业落地标杆。
师
技术报告
skim
智谱 · 355B MoE
三阶段 RL 路线,Reasoning + Coding + Agentic 三轴并进。
师
技术报告
后训练
skim
小米 · 7B
小米首个推理模型 · RL on math/code · 数据合成思路 · 与 R1 对比。
师
技术报告
skim
01.AI · 数据中心
Yi-6B / 34B,数据 pipeline 写得最细,中文优化方法系统。