推荐系统通识
搞懂推荐系统为什么越来越懂你——从数据收集、用户画像到内容匹配与反馈循环的完整逻辑。
科技 · 科技 · AI · 推荐系统 · 内容平台 · 算法原理 · 作者:问学·科技 · 2 人学过
学什么:推荐系统的整体架构与数据闭环;行为数据怎么变成用户画像;内容怎么被打标签和理解;人怎么与内容匹配;内容平台(如抖音)与 AI 产品(如 ChatGPT)在推荐逻辑上的异同;反馈循环为何让系统越用越准。
不学什么:具体算法的数学推导与代码实现(矩阵分解、神经网络细节等);推荐系统的工程架构与性能优化;商业层面的运营干预策略。
知识地图
推荐系统通览与三类经典范式
能用三句话讲清推荐系统的本质、与搜索的区别,以及「基于内容」「协同过滤」「混合」三种范式的核心直觉。
本章为整张地图锚定语言和边界,重点兑现「协同过滤」在 L2 通识中的直觉铺垫——这是模块3将深入的内容匹配方法论、模块4双塔匹配的认知前提。
端到端架构、数据闭环与评估指标
能用「数据流」视角讲清一次推荐请求的工程链路,并说出 CTR、AUC、NDCG 等核心评估指标各自在衡量什么。
本章拆解一次推荐请求从进入到反馈回流的工程链路,建立数据闭环的「单次循环」视角,并引入评估指标的初级概念——这些是模块2理解用户画像、模块5理解长期反馈循环的工程基础。
行为数据如何变成用户画像
能讲清系统如何从你的一举一动中「读出」你的兴趣,并把抽象的用户画像拆成标签、Embedding、长短期意图三个层次。
本章回答「零散行为如何被拼成一张人」的根问题,输出可被模块4匹配环节直接调用的用户侧表示(显式/隐式标签、Embedding、长短期意图),为双塔匹配的人向量做准备。
内容理解与经典匹配范式
能讲清系统如何「读懂」一段视频或一篇文章,并说出基于标签匹配与基于向量匹配两种内容侧范式的本质区别。
本章讲内容侧的对称问题——如何让机器「读懂」内容,并补足模块0承诺的经典匹配范式(基于标签 vs 基于向量的协同过滤),输出与模块2用户侧相对称的内容侧表示,为模块4双塔匹配的内容向量做准备。
双塔召回、排序与冷启动
能用「两阶段筛选」讲清人向量与内容向量的相遇过程,并说清冷启动这一推荐系统的核心工程难题。
本章是整张地图的工程核心,回答「人向量与内容向量如何相遇」,同时引入冷启动与排序多目标两大工程现实约束——这些是模块5讨论反馈循环时不可避免要回扣的概念。
反馈循环、系统风险与平台对比
能讲清「越用越准」背后的正反馈机制、信息茧房与偏差累积两类风险,并对比内容平台与生成式 AI 产品在反馈循环上的关键差异。
本章站在更高维度,把前 5 章的概念在反馈循环视角下统一,回答「为什么系统越用越准」以及「内容平台与生成式 AI 产品的逻辑异同」两个元问题,并指出系统级风险。