智谱开源GLM-5.3-Flash,320B模型把AI价格打到新低
智谱(Z.ai)正式上线并开源 GLM-5.3-Flash (320B-A18B)。它是GLM-5系列首个原生多模态模型,支持1M token上下文,并把API价格压到旗舰模型的零头。相比单纯追求更大参数,这次发布更像一次“能力/成本比”攻势。 320B参数,只激活18B GLM-5.3-Flash...
智谱(Z.ai)正式上线并开源 GLM-5.3-Flash (320B-A18B)。它是GLM-5系列首个原生多模态模型,支持1M token上下文,并把API价格压到旗舰模型的零头。相比单纯追求更大参数,这次发布更像一次“能力/成本比”攻势。 320B参数,只激活18B GLM-5.3-Flash...
Apple发布 M6 与 M5 Ultra 两款芯片,分别进入新款 Mac mini 和 Mac Studio。前者首次把2nm制程带入M系列,后者则把四晶粒架构和1.2TB/s内存带宽推向桌面端,核心方向已经很清楚:Mac正在加速成为本地AI计算平台。 M6把2nm带进Mac M6采用2nm制程,...
阿里通义千问发布 Qwen3.8-Flash ,把低成本推理与下一代架构预览放进同一次更新。该模型采用多模态 MoE 路线,主模型为125B参数,每个Token仅激活6B;其Next版本更提前引入 Qwen4 架构设计,目标直指长上下文效率与单位推理成本。 125B模型,每次只激活6B Qwen3....
2026年8月25日,小鹏官方宣布其机器人业务完成超过 9 亿美元融资,投后估值超过 63 亿美元。公司称,这是中国具身智能领域规模最大的单轮私募融资之一,资金将用于人形机器人量产和 Physical AI 模型迭代。领投方为 IDG 资本,高榕资本参与,腾讯和阿里巴巴提供战略支持。 大额融资本身不...
2026年8月24日,Meta Engineering 发布 MetaRoCE,称这是为大规模 AI 训练和推理重新设计的 RDMA 传输方案。它尝试在普通以太网上,用端点智能、路径遥测和丢包恢复能力维持 GPU 集群吞吐。Meta 计划在 10 月通过 Open Compute Project 发...
2026年8月25日,Apple 在新闻稿中同时公布 M6 与 M5 Ultra,重点不只是换一代芯片,而是把本地 AI 的竞争拉回到内存容量、带宽和神经网络计算的组合。M6 面向新一代 Mac,M5 Ultra 则把更大规模的统一内存带到桌面工作站级别。 两颗芯片分别解决什么问题 M6 采用 Ap...
2026年8月22日晚,第二届世界人形机器人运动会在北京国家速滑馆“冰丝带”开幕。赛事官方信息与 IT之家现场报道显示,本届共有来自 16 个国家的 666 支队伍、2056 台机器人参赛,赛项由首届的 26 项增加到 51 项。 规模增长只是表面变化。51 个赛项中包含 30 项竞技赛和 21 项...
2026年8月21日,RadixArk SGLang 团队与蚂蚁 Ling Infra 团队在 LMSYS 官方博客公布 Ling-3.0-flash 的单请求解码优化结果。在 4 块 NVIDIA Blackwell GPU、TP4、bf16、并发为 1 的固定环境中,调优后的 NEXTN 路径把...