资讯

一个词进了大模型,到底经历了什么?

B站-科技区·2026/9/6 14:51:06🔗 原文

📋总体概括

本文是一篇大模型原理科普,以一个词的视角走完其在Transformer架构中的完整处理流程:先通过几万行的词表嵌入为向量,再叠加位置编码弥补Transformer天然不识别顺序的缺陷(区分「狗咬人」与「人咬狗」),随后通过Query匹配机制进行注意力交流。文章点明ChatGPT、豆包、Gemini等主流大模型都建立在2017年论文《Attention Is All You Need》提出的Transformer架构之上,用6分钟讲清注意力机制的本质。

关键信息

  • ChatGPT、豆包、Gemini等主流大模型均基于2017年论文《Attention Is All You Need》提出的Transformer架构
  • 词先查一张几万行的对照表转为向量,意思相近的词对应的数字也相近
  • Transformer天然不看顺序,「狗咬人」与「人咬狗」靠位置信号区分
  • 注意力机制中每个词发出Query寻找信息,按匹配度获取其他词的内容
  • 内容以一个词的完整旅程为主线,用6分钟拆解大模型内部流程

🔥犀利点评

好科普的标准不是讲多深,而是找对视角。这篇用「一个词的旅程」替代传统零件式拆解,直接命中Transformer最反直觉的两个点:模型不识序、靠位置信号补,以及注意力本质是Query匹配的信息交换。也顺便戳破一个事实——所有明星大模型底座都是同一篇八年前的论文,差异化全在工程和数据层。缺的是内容只讲到注意力交互,前向传播后半段没交代完整。

本文由本站自动聚合,以下为原始来源:前往 B站-科技区 阅读全文