Embedding 是什么?AI 为什么能按语义搜索
Embedding 可以理解为把文字、图片、音频等内容转换成一串数字向量。AI 能按语义搜索,不是因为它像关键词搜索一样逐字匹配,而是因为相近含义会在向量空间里靠得更近。 一个直观例子 如果用户搜索“怎么退货”,文档里写的是“申请售后退款流程”,传统关键词搜索可能匹配不到;Embedding 搜索会...
Embedding 可以理解为把文字、图片、音频等内容转换成一串数字向量。AI 能按语义搜索,不是因为它像关键词搜索一样逐字匹配,而是因为相近含义会在向量空间里靠得更近。 一个直观例子 如果用户搜索“怎么退货”,文档里写的是“申请售后退款流程”,传统关键词搜索可能匹配不到;Embedding 搜索会...
RAG 是 Retrieval-Augmented Generation,中文常叫检索增强生成。它的核心不是让模型记住所有资料,而是在回答前先从外部知识库找相关内容,再让大模型基于这些内容生成答案。 它解决的是什么问题 普通大模型只依赖训练时学到的知识和当前输入,遇到公司制度、产品文档、合同条款、最...
A2A 协议,全称 Agent2Agent,指的是让不同 AI Agent 之间能够发现彼此能力、交换信息、协同完成任务的一套通用交互协议。它最近受到关注,是因为 Agent 已经不再只是一个单体助手,越来越多系统开始尝试让多个专门 Agent 分工合作。问题也随之出现:如果每家都用自己的私有接口,...
AI Native 一般指从产品底层逻辑、交互方式和工作流结构上,就是围绕 AI 能力来设计的系统,而不是在原有软件上“加一个聊天框”或“补一个生成按钮”。这个词最近越来越常被提起,是因为大家慢慢发现,很多 AI 功能之所以不好用,不是模型不够强,而是产品骨架还是老时代的骨架。 举个最直观的例子,把...
Agent Memory 指的是智能体在一次对话之外,如何保留、调用和更新与任务相关的信息。它可以是用户偏好、历史步骤、工具结果、环境状态,也可以是更长期的经验总结。这个词最近越来越常见,不是因为大家突然爱聊记忆,而是因为很多 Agent 看起来会做很多事,一进真实流程却暴露出同一个问题:上一轮刚说...
Model Router 可以理解成一个“先帮你判断该用哪个模型”的调度层。它不直接回答问题,而是在请求进入系统后,先根据任务类型、预算、速度要求、上下文长度、工具需求等条件,把请求分发给更合适的模型或 provider。最近这个概念越来越热,是因为多模型已经从选择题变成了运营题,很多产品根本不可能...
VLA 是 Vision-Language-Action 的缩写,直译就是“视觉-语言-动作”模型。它和普通多模态模型最大的不同,不只是能看图、懂文字,而是最后还要把理解结果变成可执行动作。也正因为多了这一步,VLA 现在几乎成了机器人和具身智能讨论里绕不开的关键词。 如果说传统视觉语言模型的输出大...
Reasoning Tokens 可以理解成模型在给出最终答案前,为了完成内部推理所消耗的那部分 token。它和你直接看到的输入 token、输出 token 不完全一样,因为很多推理过程并不会完整展示给用户,但它们依然占用上下文空间,也会影响延迟、费用和整体吞吐。所以最近越来越多团队开始单独盯 ...