返回文章列表

大模型

找到 23 篇相关文章 - 第2页

为什么同一个提示词每次结果都不一样?先分清随机性、上下文和工具返回

为什么同一个提示词每次结果都不一样?先分清随机性、上下文和工具返回

同一个提示词每次结果都不一样,通常不是模型“抽风”,而是你一次把三种变量都放进去了:模型本身的随机采样、对话历史带来的上下文漂移,以及外部工具或检索结果每次都可能不同。只盯着提示词本身看,往往会误判问题。 先分清是哪一种不一样 - 随机性: 就算问题一样,模型在组织句子、举例方式和段落顺序上也可能变...

AI问答 Admin
101
系统提示词和用户提示词有什么区别?为什么前者更适合定规则、后者更适合提任务

系统提示词和用户提示词有什么区别?为什么前者更适合定规则、后者更适合提任务

系统提示词和用户提示词最大的区别,不在谁先出现,而在“负责什么”。系统提示词更适合写长期稳定的规则,比如身份、语气、输出边界、禁止事项和固定流程;用户提示词更适合写这一轮要做的具体任务,比如帮我改写、总结、提取、对比什么内容。很多人把两者混在一起,结果就是规则不稳、任务也容易跑偏。 判断点 系统提示...

AI问答 Admin
93
Transformer 是什么?为什么大模型几乎都建立在它上面

Transformer 是什么?为什么大模型几乎都建立在它上面

Transformer 是一种神经网络架构。它之所以重要,不是因为名字响,而是因为它把“并行处理”和“上下文建模”这两件事做得很好。今天你看到的大多数大语言模型,本质上都离不开它或它的变体。 在 Transformer 之前,很多模型更依赖循环结构,一步一步读文本,速度慢,长距离依赖也容易掉链子。T...

AI百科 Admin
92
模型蒸馏:为什么越来越多“小模型”能追上大模型体验

模型蒸馏:为什么越来越多“小模型”能追上大模型体验

模型蒸馏是近两年被频繁提到的一个关键词,尤其是在“小模型为什么越来越强”这个问题上,它几乎总会出现。简单说,蒸馏的思路就是让较小的学生模型去学习较大的教师模型,把后者的一部分能力、行为方式和输出规律迁移过来,从而在更低成本下拿到更接近的效果。 这件事之所以重要,是因为很多团队并不需要一个最顶级、最昂...

AI百科 Admin
81
模型量化:为什么 4-bit、8-bit 总会出现在本地部署讨论里

模型量化:为什么 4-bit、8-bit 总会出现在本地部署讨论里

模型量化是本地部署和高效推理里绕不开的关键词。很多人在看模型部署教程时,经常会碰到 8-bit、4-bit、AWQ、GPTQ 这类词,但不知道它们到底在解决什么问题。简单说,量化的核心就是把模型权重用更低精度来表示,从而降低显存占用、减少内存压力,让原本太大的模型更容易跑起来。 它之所以总和本地部署...

AI百科 Admin
112
视觉语言模型(VLM):它和多模态模型、图像理解有什么关系

视觉语言模型(VLM):它和多模态模型、图像理解有什么关系

视觉语言模型,也就是 VLM,是最近讨论度很高的一类模型。很多人会把它和“多模态模型”混着说,其实两者关系很近,但不完全一样。VLM 更强调模型能够同时处理图像和文本,并把视觉信息和语言信息放进同一个理解与生成过程里。也正因为这样,它被广泛用在看图问答、文档理解、图像描述、视觉检索和界面理解等场景里...

AI百科 Admin
78

推荐工具

更多