大语言模型原理入门
用直觉和代码示例理解大语言模型的工作原理
科技 · AI · 大语言模型 · 深度学习 · 技术原理 · 作者:哈哈哈 · 3 人学过
学什么:Transformer 架构直觉、注意力机制概念、tokenization 原理、预训练与微调流程、生成/推理基本过程、主流 LLM 的能力边界
不学什么:数学公式推导、自己训练或微调模型、RLHF 细节、推理优化与部署、具体模型源码解读
知识地图
入门铺垫:神经网络与语言模型
用直觉建立"机器学习—神经网络—语言模型"三步概念框架,为后续模块打底。
为 ML 零基础的学习者铺设共同词汇,只回答"机器怎么学""神经网络是什么""语言模型在做什么"三件事,刻意推迟架构话题到下一章。
Tokenization:文本如何变成模型能吃的数字
理解分词的目的、BPE 子词方案的工作直觉,以及 token → embedding 的输入链路。
回答"模型看到的文本到底长什么样",既是理解注意力机制的必经前置,也顺带解释上下文窗口与计费等概念。
Transformer 与注意力机制直觉
用直觉和类比理解自注意力、多头、位置编码与 Decoder-only,知道现代 LLM 的架构骨架。
本地图的核心模块,回答"Transformer 内部到底在做什么",为训练流程与生成过程提供架构基础。
预训练与指令微调:模型是怎么"造"出来的
理解 LLM 如何从海量文本经过两步变成可用助手,以及训练规模的数量级感。
回答"一个 LLM 是怎么被造出来的",为生成过程与能力边界提供训练范式上的解释。
生成、推理与能力边界
理解模型如何"一个字一个字写出回答"、提示与温度如何影响输出,以及主流 LLM 擅长什么、不擅长什么。
收束全地图,回答"模型怎么产出回答"与"主流 LLM 到底能做什么、不能做什么",用具体模型(GPT、Claude、Llama、Gemini)作为锚点。