NVIDIA
跟踪英伟达从 GPU 代际到算力供给的 AI 动作,帮读者看清芯片、推理优化与云厂商合作怎样连成一条链。
跟踪英伟达从 GPU 代际到算力供给的 AI 动作,帮读者看清芯片、推理优化与云厂商合作怎样连成一条链。
2026年8月21日,RadixArk SGLang 团队与蚂蚁 Ling Infra 团队在 LMSYS 官方博客公布 Ling-3.0-flash 的单请求解码优化结果。在 4 块 NVIDIA Blackwell GPU、TP4、bf16、并发为 1 的固定环境中,调优后的 NEXTN 路径把...
Cursor 近日披露,其在 Blackwell GPU 上重构了 MoE 模型 的 token 生成路径,并将这套方法命名为 warp decode。官方称,这项底层优化带来 1.84 倍推理吞吐提升,同时让输出结果更接近 FP32 参考值;相关改进也已用于 Composer 的训练流程,以加快模...
NVIDIA 在谈及与 Google 的合作及行业竞争格局时表示,对 Google 在人工智能领域取得的进展感到欣喜,并强调公司将继续向 Google 提供相关算力产品和平台支持。NVIDIA 方面称,其平台在当前生成式 AI 浪潮中处于“领先一代”的位置。 在具体表述中,NVIDIA 宣称自家平台...
OpenAI 与 NVIDIA 宣布达成战略合作,计划为 OpenAI 的下一代 AI 基础设施部署至少 10GW 的 NVIDIA 系统,规模达数百万颗 GPU,用于训练与运行后续模型。作为支持,NVIDIA 拟在各阶段算力落地时逐步向 OpenAI 投资,最高可达 1000 亿美元;首个 1GW...
一、 ChatRTX是什么 简单来说,ChatRTX是英伟达推出的 本地RAG聊天应用 :把你的 文档、笔记、图片 等内容建库,配合大语言模型进行检索增强回答。它基于TensorRT-LLM与NIM微服务并利用RTX显卡加速,回答更快、更私密,相比把资料传到云端更可控。 核心功能包括: - 和你的文...