本周海内外AI产品集中迭代,国内阿里、腾讯、面壁、字节、中科院、昆仑万维、商汤、智谱、月之暗面等厂商接连发布多模态、具身、科研、音频图像、算力基座等模型与智能体,大量成果开源;海外三家巨头更新企业智能体与轻量化大模型;WAIC公布国际AI帮扶政策,算力紧缺促使国内企业布局自研国产算力,行业竞争转入智能体、底层基建与商业化落地的全方位比拼,一起来回顾本周发生的AI新鲜事儿吧!
AI 大模型
阿里通义实验室发布「Wan-Streamer v0.2」全模态实时双工交互模型
7月17日,阿里通义实验室发布「Wan-Streamer v0.2」端到端全模态实时双工交互模型,采用单Transformer原生流式架构,端到端延迟仅550ms;分辨率升级至640×368@25FPS,依靠Thinker-Performer双通路并行推理兼顾高清画面与低延迟,能生成任意虚拟角色实时视频对话,覆盖AI助手、教育、游戏NPC、无障碍交互等场景,配套发布相关论文与项目官网。
腾讯Robotics X等联合发布并开源「Hy-Embodied」三大具身基座模型
7月18日,腾讯Robotics X、福田实验室联合混元发布并开源「Hy-Embodied」三大具身基座模型(轻量VLM、世界认知RxBrain、高精度VLA),搭配Apexio、TairosAgent两套原生具身智能体,完整构建“感知-身体-行动”闭环;模型轻量化易端侧部署,仿真评测多项指标领跑,已落地日化工厂、导览养老等场景,同步升级Tairos开放平台,还推出人形机器人小六探索人机安全物理交互,全部模型开源对外开放。
商汤科技推出日日新「SenseNova U1 Pro」原生多模态智能体基座
7月18日,商汤科技推出日日新「SenseNova U1 Pro」原生多模态智能体基座,主打长程闭环式系统级内容交付,支持8K超清出图、高精度图文渲染与多轮自主校验修正,画面具备专业设计质感;可完成长幅叙事长卷、影视连贯分镜等高复杂度视觉任务,输出内容风格统一、细节稳定,适配营销、出版、影视等商用场景,还能为视频生成提供标准化视觉蓝图,依托前序U1、SenseNova-Vision视觉底座实现多模态深度理解与长周期智能体迭代创作。
阿里推出参数规模2.4T的「Qwen3.8」大模型预览版
7月19日,参数规模2.4T的「Qwen3.8」大模型即将正式发布并开源,被视作当下顶尖模型之一,在代码工程、专业办公等核心领域表现出色,并仍在持续进化中。其Max预览版已上线阿里Token Plan、Qoder、QoderWork平台供用户抢先体验。
Google发布三款Gemini轻量模型,旗舰3.5 Pro延期
7月20日,Google发布三款Gemini轻量模型:主力3.6 Flash更省Token、降价,各项能力小幅升级;3.5 Flash-Lite低价高速,部分性能超越旧版;3.5 Flash Cyber专攻代码漏洞,仅对内测伙伴开放。原定旗舰3.5 Pro因代码效果不及预期跳票,转而预热Gemini 4。官方宣传模型成本更低,但实测与第三方评测显示3.6 Flash智能无明显进步,综合表现落后竞品,网友吐槽其性价比差、存在文字、图文、工具调用等各类缺陷,质疑Google一味压缩成本而忽视模型核心性能。
面壁智能联合OpenBMB开源首款具身智能「MiniCPM-Robot」系列
7月20日,面壁智能联合OpenBMB开源首款具身智能「MiniCPM-Robot」系列,包含1.5B操作VLA模型「MiniCPM-RobotManip」与0.9B本地跟踪模型「MiniCPM-RobotTrack」;前者依托MiniCPM-V 4.6实现1分钟原生记忆、低算力流式推理,操作任务性能对标主流大参数量模型;后者由面壁智能与南大联合研发,支持断网本地部署,机器狗真机稳定5Hz跟踪,三类跟踪指标达开源SOTA,配套自研PhyAI极速推理框架大幅提速,现已开源,同步落地巡检、汽车仓储等产业合作场景。
字节跳动推出音频创作模型「Seed Audio 1.0」
7月20日,字节跳动推出音频创作模型「Seed Audio 1.0」,采用统一框架联合建模人声、音效、环境声,告别多模型拼接流程;支持100ms精度时间线编排、长音频音色稳定延续、单音色多情绪演绎,覆盖20余种语种且发音节奏地道,多场景生成可用率超90%,现已上线火山方舟体验中心,后续还将拓展多模态输入、分轨生成等能力。
阿里千问发布语音合成模型「Qwen-Audio-3.0-TTS」
7月20日,阿里千问发布语音合成模型「Qwen-Audio-3.0-TTS」,分为低延迟实时交互的Flash版(首包延时300ms)与高品质音频生成的Plus版,其中Plus版登顶Artificial Analysis榜首;模型实现四大核心升级,支持呼吸、情绪类细粒度标签精准调控,可通过自然语言自由描述声音风格,覆盖16种语言(10种语言评测SOTA,全部语种说话人相似度评测Plus版第一)、20种地道中文方言,原生集成语音增强能力,嘈杂带混响参考音频也能完成高质量音色克隆,音频输出提升至48KHz、单次最长合成3分钟,配套丰富多语种、方言、情绪精品音色库,现已在阿里云百炼平台开放使用,适配影视配音、游戏、多语种交互等各类场景。
中科院多所联合推出「磐石・科学基础大模型2.0」
7月20日,中科院多所联合推出「磐石・科学基础大模型2.0」,采用三层递进架构、依托800万条科学推理数据训练,兼顾通用能力与专业精度,在化学、生物、材料领域表现国际领先;配套集成八千余款科研工具的一体化平台与国产自主异构算力集群,已落地天文、化学、材料等场景,助力多家科研机构实现仿真加速、新材料研发等科研突破。
昆仑万维正式开源新一代交互世界模型「Matrix-Game 3.5」
7月20日,昆仑万维正式开源新一代交互世界模型「Matrix-Game 3.5」,提出Patch Memory、PRoPE+Warped RoPE、动静解耦记忆等核心技术,解决场景物体丢失、视角空间错乱、长时序记忆污染等行业痛点,搭配多层推理优化实现单卡720P/20FPS实时交互,自研自动化三维标注管线积累百万级带空间信息训练素材,整体采用轻量化模块化架构无需大幅扩容参数,该系列长期开源且已被英伟达、高校团队用作研发基准。
阿里千问推出第三代图像生成基础模型「Qwen-Image-3.0」
7月21日,阿里千问推出第三代图像生成基础模型「Qwen-Image-3.0」,以“实”为核心主线,围绕内容丰实、细节真实、知识厚实三大能力实现生产力升级,模型最高支持4.5K Token输入,可一次性生成九宫格多主题复杂图文、多层嵌套界面等高密度版面,能清晰渲染10px小字、精准还原学术论文公式、手写批注、人像纹理并修复古画,同时原生支持12国语言,可仿真各类网页、软件UI界面,目前阿里云百炼、千问AI平台开放API邀测,Qwen Studio与千问APP也将上线免费体验,适配教育、设计、电商等多类专业图文创作场景。
MindLab推出「Macaron V1」,MoL技术重塑GLM5.2能力上限
7月21日,MindLab推出基于GLM5.1/5.2后训练优化的模型「Macaron V1」,独创MoL多LoRA专家架构解决多能力训练冲突;模型分为748B旗舰Venti(四大专业LoRA专家,上下文最高2M)、35B轻量Tall(适配本地部署)两个版本,配套UI4A、REPL、MinT自研工具,自建两套评测基准,推理速度优异,可实现3D网页、物理仿真等复杂开发,支持插件接入Claude Code,方便灵活拓展模型能力。
上海人工智能实验室联合发布跨学科科学基础模型「SciReasoner」
7月22日消息,上海人工智能实验室联合多所海内外顶尖机构发布跨学科科学基础模型「SciReasoner」,首创原生结构推理思路,将蛋白、小分子、晶体三维结构转化为专属结构Token作为核心推理依据,弥补传统科学大模型仅靠语言关联推理、忽视空间结构的短板;该模型在低同源蛋白功能注释、化学逆合成、药物虚拟筛选、晶体材料性质预测等任务中均大幅超越现有主流方案,推理过程可溯源,可作为统一底座支撑蛋白研究、药物开发、化学路线设计、新材料研发等场景,实现AI基于结构证据完成可解释的科学推理。
AI Agent
腾讯混元推出首款递归自我改进科研智能体「Hyra-1.0」
7月21日,腾讯混元推出首款递归自我改进科研智能体「Hyra-1.0」,依托轻量化异步循环框架Hyra Harness,依靠经验库、多提案智能体、双层共进化评估机制实现方案与评价标准同步迭代;该智能体在AI底层研发、数学难题、天文预测、量子电路、抗癌分子设计等科研工业场景大幅突破,刷新多项公开基准最优结果,还可完成游戏AI、3D建模、乐曲配器等创意类任务,相关实验成果已开源,后续将与腾讯新一代模型、产品持续协同进化。
Anthropic在Claude Cowork推出「Record a Skill」功能
7月21日, Anthropic在Claude桌面端Cowork推出面向Pro、Max及团队用户的「Record a Skill」功能,用户授予录屏录音权限后,实操工作流并口述隐性判断逻辑,平台可自动生成可通过斜杠命令调用的专属自动化Skill;该功能无需手动撰写流程文档,大幅降低沉淀实操经验的门槛,能留存难以书面化的业务细则,可用于工作交接、流程自动化,但也带来岗位职能转变的趋势,AI可复刻标准化流程,人的核心竞争力转为处理复杂、独特的定制化工作。
腾讯自研AI创意智能体「Miora」正式全量上线
7月22日,腾讯自研AI创意智能体「Miora」正式全量上线,新用户注册即免费领取1000创作积分,它具备记忆、需求理解与多智能体协同能力,接收用户创意目标后会自动拆解任务,调度对应专业模块统一产出风格一致的海报、短视频、3D、UI、IP全案等多模态内容,创作前会主动确认画面参数、风格等细节,内置品牌视觉全案等8类官方技能,适配设计小白、设计师、短视频从业者等各类人群,可大幅缩短创意制作耗时。
Anthropic对Claude托管智能体平台「CMA」完成六项能力升级
7月23日消息,Anthropic升级其Claude托管智能体平台「CMA」,推出六项更新:会话技能上限扩至500、支持五档推理力度、一键创建种子会话、可视化子智能体运行、新增7类生命周期webhook、简化接口版本配置,依托沙盒实现多智能体协同;不同于OpenAI、Google的发展路线,Anthropic主打智能体操作系统,深耕智能体底层基础设施。
腾讯云正式发布云端智能体「CodeBuddy NPC」
7月23日,腾讯云正式发布云端智能体「CodeBuddy NPC」,依托CNB研发平台深度打通代码仓库、Issue、CI/CD等全研发链路,具备研发记忆可自主完成编码、提PR、自测迭代直至交付成果,支持多NPC组队协同处理复杂项目,经优化后首轮Token消耗降幅超90%,企业还能按需搭配不同模型平衡成本与性能,且无需改造现有研发工具链即可接入使用。
AI 工具
无问芯穹在WAIC推出面向AGI的Agentic Infra基础设施方案
7月20日,在2026年WAIC大会上,无问芯穹提出AGI时代核心基础设施为AI原生Agentic Infra,发布“前店后厂一中心”完整体系:算力集散中心可聚合跨地域、多代际异构算力,支持超远距离跨域混训与万卡级稳定强化学习;Token工厂推出跨集群异构PDD推理架构,大幅降低首Token时延与生成成本,平台Token调用量同比暴涨40倍;配套覆盖文娱、医疗、法律、能源的行业解决方案,自研运维、算子生成等基础设施智能体蜂群实现平台自主优化;同时布局具身智能,推出云边端统一调度平台、RLinf V0.3真机强化学习框架与Mizar-Robo端侧推理优化体系,全方位支撑数字与物理场景下AI规模化落地。
OpenAI推出企业AI智能体一站式运营平台「Presence」
7月22日,OpenAI推出企业AI智能体一站式运营平台「Presence」,可打通企业内部数据、制度、软件与业务流程,自动化处理客服、销售、账单、保险理赔、员工IT诉求等工作,内置模拟测试、安全护栏、人工复核、AI评估、Codex优化工具与语音对话能力,遵循最小权限原则方便企业管控智能体操作边界与人工程序,当前仅对达标企业有限开放,需官方团队或合作伙伴协助部署;该产品是OpenAI从单纯售卖基础模型转向高粘性企业软件服务商的关键战略产品,Anthropic等同行也已同步发力同类企业级AI服务。
市场动态
习近平宣布中国支持全球人工智能发展重大举措
7月17日,习近平主席在上海举办的2026世界人工智能大会开幕式上发表讲话,提及上海成立世界人工智能合作组织,并宣布三项全球AI合作举措:未来五年为发展中国家提供5000个AI研修名额、面向多个区域合作组织搭建国际AI应用合作中心、推动气象预警方案“妈祖”落地30个国家。
Kimi K3算力告急,暂停新用户订阅并规划算力扩容
7月19日,月之暗面发布公告,因Kimi K3上线后用户请求量远超预期、算力集群濒临饱和,为保障老会员使用体验,平台即刻暂停C端新用户订阅,全力推进算力扩容,待资源到位后逐步放开名额,后续还将拆分通用与代码类会员权益,精细化分配算力资源。
智谱三线布局自研算力体系,摆脱英伟达依赖筑牢GLM底层算力底座
7月21日消息,受海外高端GP限制、算力成本激增影响,智谱通过建成1GW全国产芯片大型数据中心并部分投运,搭建多座万卡算力集群;斥资数亿元收购中科加禾、洽谈定制AI芯片三条路径搭建自主算力底座;行业内DeepSeek也同步布局自有算力与自研芯片,依托十五五全国一体化算力网、万亿级算力基建规划等政策利好,头部大模型企业纷纷转向自研运营算力,缓解并发压力、压缩长期成本。