大语言模型原理入门

用直觉和代码示例理解大语言模型的工作原理

科技 · AI · 大语言模型 · 深度学习 · 技术原理 · 作者:哈哈哈 · 3 人学过

学什么:Transformer 架构直觉、注意力机制概念、tokenization 原理、预训练与微调流程、生成/推理基本过程、主流 LLM 的能力边界

不学什么:数学公式推导、自己训练或微调模型、RLHF 细节、推理优化与部署、具体模型源码解读

知识地图

  1. 入门铺垫:神经网络与语言模型

    用直觉建立"机器学习—神经网络—语言模型"三步概念框架,为后续模块打底。

    为 ML 零基础的学习者铺设共同词汇,只回答"机器怎么学""神经网络是什么""语言模型在做什么"三件事,刻意推迟架构话题到下一章。

  2. Tokenization:文本如何变成模型能吃的数字

    理解分词的目的、BPE 子词方案的工作直觉,以及 token → embedding 的输入链路。

    回答"模型看到的文本到底长什么样",既是理解注意力机制的必经前置,也顺带解释上下文窗口与计费等概念。

  3. Transformer 与注意力机制直觉

    用直觉和类比理解自注意力、多头、位置编码与 Decoder-only,知道现代 LLM 的架构骨架。

    本地图的核心模块,回答"Transformer 内部到底在做什么",为训练流程与生成过程提供架构基础。

  4. 预训练与指令微调:模型是怎么"造"出来的

    理解 LLM 如何从海量文本经过两步变成可用助手,以及训练规模的数量级感。

    回答"一个 LLM 是怎么被造出来的",为生成过程与能力边界提供训练范式上的解释。

  5. 生成、推理与能力边界

    理解模型如何"一个字一个字写出回答"、提示与温度如何影响输出,以及主流 LLM 擅长什么、不擅长什么。

    收束全地图,回答"模型怎么产出回答"与"主流 LLM 到底能做什么、不能做什么",用具体模型(GPT、Claude、Llama、Gemini)作为锚点。