大模型
讲清大模型这一技术品类:它是什么、靠什么能力成为 AI 应用的基础,选型时要看的关键维度,以及它的能力边界在哪。
大模型是当前 AI 应用的技术底座:以 Transformer 架构为代表,靠海量文本训练获得理解、生成和推理能力,再经微调、提示词和工具调用接入具体场景。它的价值在通用能力带来的范式变化,不在参数规模本身;边界同样清晰:知识有截止、会产生幻觉、长任务离不开外部工具和流程约束。
讲清大模型这一技术品类:它是什么、靠什么能力成为 AI 应用的基础,选型时要看的关键维度,以及它的能力边界在哪。
DeepSeek 终于把"赚钱"这件事摆上了台面。9 月 24 日,据 The Information 报道,DeepSeek 的年化收入 run rate 已达到 10 亿美元,短短几个月内翻了一倍多。消息来自两位知情人士:公司首席执行官梁文锋在近期一次投资者会议上披露了这一数字。 翻倍的推手:涨...
温度参数是控制大语言模型"输出随机程度"的一个采样参数,藏在多数 AI 对话产品的高级设置和 API 参数里。你平时很少直接看到它,但它决定了模型的回答是严谨收敛,还是天马行空。 理解它的关键只有一句话:模型每生成一个词,其实都是先算出所有候选词的概率分布,再从中"抽"出一个词。温度参数调整的就是这...
Gemini 4 正在进入"早期后训练"阶段,Google 希望它的发布时间"远早于"今年年底。这是 Google DeepMind 新任负责人 Koray Kavukcuoglu 在 2026 年 9 月 23 日的首次公开亮相中透露的消息。他在 The Information 主办的 AI Ag...