分词器是什么?同一句话,为什么换个模型 token 数就不一样
分词器是你发给模型的那句话最先经过的部件,它不负责理解,只负责切分和编号。文字送进大模型之前,分词器会先把它切成一个个 token,再换成词表里的编号,模型读到的就是这串编号。想通这一点,不少困惑就有答案:token 既不是字,也不是词。 它切的不是字,而是出现概率 目前主流的分词器多采用 BPE ...
分词器是你发给模型的那句话最先经过的部件,它不负责理解,只负责切分和编号。文字送进大模型之前,分词器会先把它切成一个个 token,再换成词表里的编号,模型读到的就是这串编号。想通这一点,不少困惑就有答案:token 既不是字,也不是词。 它切的不是字,而是出现概率 目前主流的分词器多采用 BPE ...
模型对齐指的是在预训练完成之后,通过针对性训练,让大模型学会按人类期待的方式回答:诚实、不作恶、不瞎编、拒绝危险请求。预训练只教会模型"会说话",对齐才是让它学会"好好说话"。 对齐不是预训练,也不是微调 预训练:用海量文本训练,让模型学会语言规律和世界知识——这个阶段的模型只是个"文本续写器"。 ...
多模态模型是能同时处理文本、图像、音频等多种信息形态的 AI 模型:给它一张图、一段语音、几行文字,它能综合起来理解并回应。但先划一条边界——"多模态"不等于"全能",通道变多了,理解力并没有同步翻倍。它能描述照片里有几个人在做什么,却分不清谁在开玩笑。 三种常见形态:理解型、生成型、统一型 三类很...
SFT 监督微调(Supervised Fine-Tuning)是聊天模型“上岗”前的培训环节:用成千上万条“指令-回答”示范数据,教预训练好的大模型按人类期望的方式说话做事。注意,它不是给模型灌输新知识,而是教模型“把已经学到的东西,用对格式讲出来”。 预训练、SFT、RLHF 各管什么 聊天模型...
RAG(Retrieval-Augmented Generation,检索增强生成)是一种让大语言模型先查资料再回答的技术:模型在生成答案之前,先从外部知识库中检索与问题相关的内容,再把这些内容作为依据写出回答。它解决的正是模型的两个老毛病——训练数据有截止日期、遇到不知道的事容易一本正经地编造(幻...
知识蒸馏是一种让小模型(学生模型)向已经训练好的大模型(教师模型)学习的技术。它由 Geoffrey Hinton 等人在 2015 年的论文《Distilling the Knowledge in a Neural Network》中正式提出,目标是让参数更少、速度更快的小模型保留尽可能多的大模型...
思维链(Chain-of-Thought,简称 CoT)是一种提示技巧:不让模型直接给答案,而是先让它把中间推理步骤写出来,最后才给结论。解数学题时,模型会先列出"设未知数、列方程、求解",而不是直接报数字。这种"先写过程"的约束,常能明显提高复杂问题的正确率。 核心做法:先写步骤,再给答案 大语言...
上下文窗口是模型一次能"看到"的 token 总量上限:提示词、对话历史、检索到的资料,加上模型已写出的回复,全部按顺序排进这段序列。它决定模型的工作台有多大,但不决定它有多聪明——1M token 的窗口装得下上千页文档,却不等于模型真能用好每一页。 上下文窗口里到底装了什么 窗口里装的不是文件,...