返回文章列表

模型推理

找到 7 篇相关文章

Reasoning Tokens 是什么?为什么它成了很多团队盯推理成本时的新指标

Reasoning Tokens 是什么?为什么它成了很多团队盯推理成本时的新指标

Reasoning Tokens 可以理解成模型在给出最终答案前,为了完成内部推理所消耗的那部分 token。它和你直接看到的输入 token、输出 token 不完全一样,因为很多推理过程并不会完整展示给用户,但它们依然占用上下文空间,也会影响延迟、费用和整体吞吐。所以最近越来越多团队开始单独盯 ...

AI百科 Admin
122
Inference-Time Compute 是什么?为什么推理模型时代大家开始重新计算“多想一会儿”的价值

Inference-Time Compute 是什么?为什么推理模型时代大家开始重新计算“多想一会儿”的价值

Inference-Time Compute 说的不是训练时花了多少算力,而是模型在真正回答用户问题那一刻,愿意投入多少额外计算去想、去试、去筛。这个词最近变热,是因为推理模型把一个老问题重新摆到了台面上:如果模型不是“立刻给答案”,而是允许它多算一点,结果会不会更好?答案通常是会,但账也会更复杂。...

AI百科 Admin
92
长上下文压缩(Context Compression)是什么?为什么模型上下文越来越长,它反而更重要

长上下文压缩(Context Compression)是什么?为什么模型上下文越来越长,它反而更重要

长上下文压缩说的不是简单删字,而是把长材料里的关键信息尽量保留下来,用更短、更可喂给模型的形式重新组织。这个概念会越来越重要,恰恰是因为上下文窗口越来越长了。窗口变大不代表你就该什么都往里塞,真正的问题变成:哪些内容值得保留,哪些只是占位置。 为什么“窗口更长”反而让压缩更关键 - 长材料一旦全塞进...

AI百科 Admin
71
Test-Time Scaling 是什么?为什么模型“多想一会儿”会突然变强

Test-Time Scaling 是什么?为什么模型“多想一会儿”会突然变强

Test-Time Scaling 可以理解成:在模型真正回答问题时,给它更多推理预算、更多尝试次数或更长的思考空间,从而换取更好的结果。它之所以火,是因为很多人发现,模型能力不只取决于训练时多大,还取决于“回答当下愿不愿意多算一会儿”。 它到底在扩什么 - 可能是更长的推理步骤,让模型别太快下结论...

AI百科 Admin
98
AI 能联网搜索是不是就等于知道最新事实?搜索、引用和推理不是一回事

AI 能联网搜索是不是就等于知道最新事实?搜索、引用和推理不是一回事

AI 能联网搜索,不等于它自动知道最新事实,更不等于它已经替你验证过事实。搜索、引用和推理其实是三件事:先找到资料,再挑哪些资料能用,最后根据资料组织答案。任何一步出错,最后看起来很顺的回答都可能有偏差。 环节 它在做什么 最容易出的问题 搜索 从网页或数据库里找相关信息 搜到旧内容、营销页或不完整...

AI问答 Admin
68

推荐工具

更多