本周AI行业密集迭代,深度求索、商汤、智谱、腾讯、阿里云等推出多款多模态、视频、端侧翻译模型,海外Harvey基于Kimi K3打造垂直法律模型,自变量机器人发布具身世界模型;工具端出现Agent专用Linux系统、人形机器人全球数据采集项目、AI短剧生产工具,Claude补齐浏览器能力并开放免费培训课程;技术上出现EnvHarness、Recirculation等新算法以及Anthropic AI原生SDLC开发手册;市场层面苹果更新适配Agent的Mac硬件,英伟达拟天价收购Hugging Face引发行业对平台中立性的讨论,一起来回顾本周发生的AI新鲜事儿吧!
AI 大模型
深度求索上线实验性多模态视觉模型「DeepSeek-V4-Flash-Vision-Exp」
8月21日,深度求索上线实验性多模态视觉模型「DeepSeek-V4-Flash-Vision-Exp」并开放API调用,该模型纯文本Agent、推理能力与V4-Flash正式版持平,多模态Agent评测成绩大幅提升、性能接近Opus-4.8,可适配各类Agent框架,支持图文混合输入,图片按最多384token计费,价格和V4-Flash保持一致,同时同步推出免费Files API,支持base64、外部URL、file_id三种图片传入途径,可实现PPT生成、网站重构、前端Demo开发等多类实践场景。
商汤科技开源8B轻量级原生统一多模态模型「SenseNova U1.5 Lite」
8月21日,商汤科技正式开源8B轻量级原生统一多模态模型「SenseNova U1.5 Lite」,依托NEO-unify架构与MOPD多专家在线策略蒸馏技术,将多专家能力融合至单体模型,原生支持3-4k字符超长复杂指令,具备原生4K输出、可靠图像编辑、高精度文字排版、精细区域控制等能力,经任务导向强化学习后,在指令遵循、画面质感、编辑保真度上实现提升,单卡即可运行,可完成海报、信息图、多参考图融合、局部精准修改等真实视觉生产任务,模型已上线GitHub、Hugging Face、魔搭社区,同时提供SenseNova Studio在线体验入口。
法律AI独角兽Harvey发布基于Kimi K3后训练的法律专用模型「Tenet」
8月23日,法律AI独角兽Harvey发布基于Kimi K3异步强化学习后训练的法律专用模型「Tenet」,依托Kimi K3超长上下文与智能体能力,模拟律所真实工作流开展大规模智能体任务训练,在严苛的全通过式法律评测基准下性能获得显著提升;该案例印证“开源基座+行业后训练”的可行路径,垂直企业可注入自有专业数据与业务标准打造自有模型,不再局限于提示词、RAG等应用层改造,Kimi系列也已被海外多家头部垂直AI项目选为底座,中国开源大模型正成为全球行业创新的重要基座。
阿里云百炼正式开放「Wan3.0 Video」视频生成API
8月24日,阿里云百炼正式开放「Wan3.0 Video」视频生成API,全部开发者可直接调用,该模型支持原生30秒1080P视频生成,具备OMNI全能参考能力,可接收图、文、音频、视频、文档、网页多类输入,在角色一致性、空间逻辑、音画同步、图文信息还原上实现升级,适配影视、广告、设计、文旅等生产场景;服务按输入加输出总秒数计费、失败不计费,标准版限时7折,同时提供Prime优速推理档位,新用户还享有30秒免费额度。
3.3GB压至440MB,腾讯混元极低bit翻译模型实时
8月26日,腾讯混元针对1.8B端侧翻译底座「Hy-MT2-1.8B」推出2-bit拉伸弹性量化SEQ、1.25-bit自研Sherry稀疏三值量化两套极致压缩方案,将原本3.3GB的模型最低压缩至440MB且翻译质量基本无损,支持33种语种互译;联合英特尔完成x86平台算子优化大幅提升推理速度,并落地于B站直播弹幕实时翻译场景,实现本地端侧翻译,兼顾低成本、隐私安全与翻译效果,相关模型权重、论文与代码均已开源开放。
智谱上线并开源原生多模态模型「GLM-5.3-Flash」
8月26日,智谱上线并开源原生多模态模型「GLM-5.3-Flash」,总参数320B、激活参数量18B,采用稀疏与线性注意力混合架构以及流形约束超连接技术,综合能力对标Claude Opus 4.8,编程表现相当,服务定价大幅降低;模型具备视觉编码能力,可借助视觉反馈迭代优化代码、3D工程与GUI交互,同时强化Office文档、金融、法律等专业任务处理,此前以匿名模型OxAlpha完成大规模公测,现已实现基于国产芯片集群的规模化部署,通过多项底层优化让硬件效率比肩英伟达GPU,目前开放API、在线体验与开源下载。
自变量机器人发布「WALLSS」下一尺度自回归世界模型
8月27日,自变量机器人发布「WALLSS」下一尺度自回归世界模型,针对现有世界模型忽视动作指令、长时推演画面崩坏、虚实效果难以对齐三大痛点,采用由粗到细逐层细化的生成架构,通过尺度对齐动作注入、尺度压缩长时记忆、视觉动力学在线策略对齐等技术,实现动作可控、60秒稳定推演,虚拟与真实世界任务成功率吻合度达93%,该模型兼具模拟器与规划器能力,可完成“生成方案验证效果筛选最优”闭环,能直接输出动作指令,为机器人提供低成本虚拟训练试验场,缩短具身智能策略迭代周期。
腾讯混元发布并开源新一代面向生产力的大模型「Hy4 preview」
8月28日,腾讯混元发布并开源新一代面向生产力的大模型「Hy4 preview」,总参数770B、激活参数49B,上下文长度达1M,稳居开源模型第一梯队;依托内部多领域专家共建数据及与WorkBuddy等产品协同优化,该模型在软件工程、游戏开发、智能办公、科学研究场景能力突出,还可参与自身研发迭代形成初步递归自我改进闭环,用户可在元宝、WorkBuddy、CodeBuddy等腾讯产品体验,也可通过腾讯云Tokenhub、OpenRouter调用API,WorkBuddy与CodeBuddy开启为期两周限时免费活动,混元采用preview先行、正式版跟进的模式持续敏捷迭代。
AI 工具
「Omarchy 4.0」专为Agent打造的Linux系统,让AI直接操控操作系统
8月21日,Ruby on Rails作者DHH开发的Linux发行版「Omarchy 4.0」,将操作系统本身打造为Agent的Harness,系统全部配置以文本形式暴露,允许AI智能体直接读写、操作系统,可接入多家主流大模型,社区快速产出大量插件,项目收获硅谷八位行业大佬共800万美元捐赠并成立Omacom基金会;区别于Windows、macOS对AI系统权限的限制,它探索由智能体操作电脑的新范式,但现阶段仅面向开发者,存在稳定性、中文、硬件兼容等问题。
Anthropic上线免费教育平台「Claude Academy」,公开内部入职培训课
8月22日,Anthropic将原本用于内部新员工入职培训的课程对外免费开放,推出「Claude Academy」,平台汇集289项课程、教程与实战案例,覆盖AI基础、Claude Code、API、MCP、智能体到生产部署全链路,注册免费Claude账号即可学习,完成学习可获取能用于LinkedIn的结业徽章;课程核心为AI Fluency 4D框架,分别聚焦任务委派、需求描述、结果甄别、审慎尽责四大维度,不侧重Prompt技巧,重在培养人与AI协作的心智与判断力,还针对不同人群设置学习路径,同时提出AI技巧会快速贬值,需要持续更新认知,该课程上线后在网络上引发广泛讨论。
UC Berkeley开源面向MoE模型的本地推理引擎「FreeToken」
8月23日,UC Berkeley开源面向MoE模型的本地推理引擎「FreeToken」,宣称推理速度较Ollama快2-4倍,可实现8GB显卡以39.3 tokens/s运行Qwen3.6-35B、32GB显卡跑DeepSeek-V4-Flash 284B、96GB显卡运行GLM-5.2 753B;它利用MoE模型仅激活部分专家的特性,将模型权重存放于系统内存,GPU缓存常用专家,会对设备带宽做实测,动态把未命中专家调度给GPU PCIe传输或CPU计算,还针对Agent场景做增量prefill优化,大幅降低首token延迟,提供兼容OpenAI、Anthropic的API,项目以Apache 2.0协议开源,不过社区对其实测性能存在争议,也关注prefill阶段的延迟问题,其核心价值在于CPU-GPU统一调度与Agent场景优化,让普通消费硬件有机会本地运行超大MoE模型。
Figure发起Index全球数据征集:用人类真实行为喂养人形机器人
8月26日,Figure AI推出Index项目面向全球用户采集真实世界人类行为数据,用于训练其Helix人形机器人VLA模型,该项目APP已覆盖108个国家地区,收获超4.4万周活创作者、1600万条上传视频,Figure计划未来12个月投入超10亿美元用于数据与算力,平台通过筛选、真实性核验、去重重组、标注等流程把原始视频加工为机器人可用训练素材,已向创作者支付超1500万美元报酬,Figure意在借此搭建人形机器人时代的数据基础设施,认为现实交互数据才是人形机器人产业的核心竞争关键。
免费「Agnes Video 2.5」上线Pavo:用Harness降低AI短剧制作成本
8月26日,「Agnes Video 2.5」系列上线Pavo平台,其中「Agnes Video 2.5 Flash」完全免费,支持720p、4-12秒视频生成,标准版每日赠送免费积分,该视频模型具备不错的人物表情、动作连贯性,适配AI短剧创作;Pavo借助短剧Harness可把简单故事自动拆解为多集剧本、人物场景道具资产库与分镜脚本,还提供无限画布节点分支、角色四视图设定、3D导演台等能力,能够管控角色一致性、自定义机位构图,减少反复抽卡和无效返工,在压低单次生成成本的同时,通过流程化工具降低AI短剧的整体制作门槛。
Claude Cowork上线沙箱隔离式内置浏览器,补齐Agent网页交互能力
8月27日,Anthropic为Claude Cowork上线沙箱隔离式内置浏览器,支持网页导航、信息抓取、点击与表单填写,面向Pro、Max、Team付费用户推送,企业版需管理员开启;该能力晚于OpenAI Codex、Claude Code等竞品,它和Chrome扩展Claude in Chrome分工不同,前者为独立隔离环境,后者操控用户现有浏览器,内置浏览器存在提示注入风险,官方建议优先访问可信站点,此次更新也体现出Cowork仍在补齐Agent必备的网页交互基础能力。
技术突破
Google联合提出「EnvHarness」,无需修改底层环境,自动强化智能体训练信号
8月23日,Google联合圣路易斯华盛顿大学等机构提出「EnvHarness」,类比Agent Harness的思路,为智能体交互的环境增设一层外部可编程封装组件,无需改动底层环境本身,依靠reset、step、obs标准接口,通过环境布置、交互规则、链接环境三类组件调整环境初始状态、交互逻辑与任务跳转,还可借助循环工程流程,分析Agent运行轨迹自动生成适配的EnvHarness,为强化学习、自进化Agent提供更优质训练信号,在网页导航、代码生成等任务上提升效果,但存在采样效率不足、专用组件待补充的局限,相关资源已开源。
Anthropic发布AI原生软件开发生命周期SDLC手册
8月26日,Anthropic发布AI原生软件开发生命周期SDLC手册,针对AI大幅加快代码生成、但传统评审测试发布等流程拖慢整体交付的痛点,提出将传统单向开发流水线改造为循环工作流,在规划、设计、构建、测试、部署、维护各阶段产出intent.md、spec.md等可被人与AI共同读取、版本可追溯的文档,同时引入CLAUDE.md、Skill、Hook、Plan mode、Subagent、Evals评测等机制约束AI行为、规避风险,人类聚焦关键节点审核而非机械编码,文档给出分层落地路径,团队可按需逐步引入能力,该方案虽基于Claude生态,但其流程思路可供不同技术团队参考借鉴。
DeepMind提出「Recirculation」深层激活回流机制,小模块性能反超全量微调
8月27日,DeepMind提出「Recirculation」深层激活回流机制,无需改动原有Transformer主干权重,推理阶段打通跨层信息回路,让深层已形成的语义状态回流参与后续计算;在此基础上增加小型MLP得到Adaptive Recirculation,可动态生成逐维回流系数,在Gemma3上语言建模平均困惑度降幅达23.0%,效果甚至超过全量微调,该方案可改善语义消歧、指令遵循与数学推理能力,但Prefill阶段长上下文会带来速度开销,下游任务收益不稳定,控制器效果还受训练数据分布影响,该工作证明冻结主干权重、优化模型内部信息流同样能够提升大模型性能。
市场动态
新款Mac mini/Studio发布:苹果面向AI Agent重塑桌面硬件
8月25日,苹果发布搭载M6、M5 Pro、M5 Max、M5 Ultra芯片的新款「Mac mini」与「Mac Studio」,整机定价有所上涨,9月22日开启发售;其中2纳米M6芯片的Mac mini AI性能大幅提升,定位兼顾普通用户与AI开发者,可运行本地大模型及轻量Agent,M5 Pro版本支持多机集群,「Mac Studio」的M5 Ultra机型凭借超大统一内存、UltraFusion互联与Thunderbolt 5,可做多机分布式推理,能够承载千亿级大模型;依托Apple Silicon统一内存架构,新一代Mac不再仅服务人的直接操作,也可作为常驻硬件为AI Agent提供本地运行环境,产品层级也开始按AI工作负载进行划分。
英伟达拟以129亿美元收购Hugging Face,拿下开源AI生态入口
8月27日,据外媒消息,英伟达拟以129亿美元收购AI开源模型社区Hugging Face,该平台是全球重要的AI开发者基础设施,当前年化收入超1.5亿美元;这笔收购溢价极高,英伟达意在拿下开放模型分发入口,对冲各大厂商自研芯片带来的GPU需求风险,同时借该平台迂回布局算力云业务,也是英伟达大规模布局AI生态的又一动作,但收购也引发外界对Hugging Face能否继续保持平台中立性的担忧,交易最终能否落地仍有待观察。