基础模型 (2020-2022)¶
从 GPT-3 引爆 scaling 信仰,到 ChatGPT 重塑产品形态 —— 大模型从研究范式变成商业范式的关键 3 年。
收录笔记(33 篇)¶
- ControlNet — 用零卷积把可控空间条件接入冻结的扩散模型 · 2023 · Zhang 等
- Chinchilla — 用最优算力分配证明当时所有 LLM 都「训练不足」 · 2022 · Hoffmann et al. (DeepMind)
- Classifier-Free Diffusion Guidance — 一行代码砍掉外挂分类器,统一所有现代文生图 · 2022 · Ho 等
- CoT — 用一句「让我们一步步思考」解锁 LLM 的推理能力 · 2022 · Wei et al. (Google Brain)
- Constitutional AI — 用一份「宪法」+ AI 反馈替换数万人类有害样本标签 · 2022 · Bai 等
- DiT - 当扩散模型把 U-Net 换成 Transformer · 2022 · Peebles 等
- DreamBooth — 用 3-5 张照片把任意主体「植入」文生图模型 · 2022 · Ruiz 等
- Flamingo: a Visual Language Model for Few-Shot Learning · 2022 · Alayrac et al. (DeepMind)
- FlashAttention:不减少一次注意力计算,为什么反而更快 · 2022 · Dao 等
- Imagen — 用大语言模型理解提示词的级联扩散文生图 · 2022 · Saharia 等
- InstructGPT — 用 RLHF 把 GPT-3 从续写器训练成听话的助手 · 2022 · Ouyang et al. (OpenAI)
- MAE — 用 75% 掩码遮蔽让 ViT 学会自监督预训练 · 2022 · He et al. (FAIR)
- PaLM — Pathways 把 dense LLM 推到 540B 的那一刻 · 2022 · Chowdhery 等
- ReAct: Synergizing Reasoning and Acting in Language Models · 2022 · Yao 等
- Stable Diffusion — 把扩散搬进 latent space,让消费级显卡也能生成图像 · 2022 · Rombach et al. (CompVis)
- Whisper - 用 68 万小时弱监督音频把语音识别做成通用接口 · 2022 · Radford 等
- AlphaFold2 — 用 attention + Evoformer 把蛋白质结构预测推到原子级精度 · 2021 · Jumper et al. (DeepMind)
- CLIP — 用 4 亿对图文对比让视觉模型听懂自然语言 · 2021 · Radford et al. (OpenAI)
- Codex — 把大语言模型训练到会写代码 · 2021 · Chen 等
- DALL-E — 把图像生成改写成语言模型问题 · 2021 · Ramesh 等
- LoRA — 用低秩矩阵把大模型微调成本砍掉 99% · 2021 · Hu et al. (Microsoft Research)
- Swin Transformer - 用 shifted windows 把 ViT 改造成通用视觉骨干 · 2021 · Liu 等
- DDPM — 用千步去噪把扩散模型推上图像生成王座 · 2020 · Ho, Jain, Abbeel (UC Berkeley)
- DETR — 把目标检测改写成集合预测的 Transformer · 2020 · Carion 等
- GPT-3 — 当语言模型大到 175B,prompting 成为新的编程范式 · 2020 · Brown et al. (OpenAI)
- MoCo:用队列和动量编码器,把视觉自监督从 pretext task 带向通用表示学习 · 2020 · He 等
- NeRF — 用一个 MLP 把场景编码成可微分的辐射场 · 2020 · Mildenhall et al. (UC Berkeley)
- RAG — 把维基百科变成生成模型的可替换记忆 · 2020 · Lewis 等
- Scaling Laws — 用幂律刻画 LLM 的损失、参数与算力之间的关系 · 2020 · Kaplan et al. (OpenAI)
- Score SDE — 用随机微分方程统一扩散与 score-based 生成 · 2020 · Song 等
- SimCLR — 一个朴素的对比损失,把自监督视觉学习推上 ImageNet 线性评测的王座 · 2020 · Chen 等
- ViT — 用纯 Transformer 把卷积赶下视觉王座 · 2020 · Dosovitskiy et al. (Google Brain)
- wav2vec 2.0 - 让语音识别先听 5.3 万小时、再看 10 分钟标注 · 2020 · Baevski 等