MIAOYUN | 每周AI新鲜事儿 260717

本周国内外集中发布各类AI成果:快手、阶跃、腾讯、商汤、千问、小米、Kimi等国内厂商,相继推出代码、端侧、OCR、视觉、语音、视频、具身、超大参数多模态模型;斯坦福、LibTV、金山、稀宇、昆仑万维推出科研、视频、办公、金融、短剧类AI智能体,浪潮、阶跃配套发布Agent算力硬件与原生智能体系统;同时银河通用、逐际动力发布机器人相关新技术,Anthropic发布大模型语言风格相关研究,行业显现端侧轻量化、多模态融合、智能体商业化、具身智能规模化趋势,一起来回顾本周发生的AI新鲜事儿吧!

AI 大模型

快手KwaiKAT发布「KAT-Coder-Pro V2.5」代码大模型

7月10日,快手KwaiKAT发布「KAT-Coder-Pro V2.5」代码大模型,聚焦长程软件工程与复杂Agent工作流能力升级;依托AutoBuilder、KwaiClawEnv两套自动化数据流水线构建海量可运行仓库与业务任务训练样本,搭配多框架RL训练、长程信用分配、分层奖励机制及多教师在线蒸馏技术,兼顾代码工程、通用工具调度、前端生成等多类能力无能力损耗;在SWE-Bench Pro等多项基准测试成绩领先主流竞品,可自主完成仓库问题定位、批量工具交互、项目自测修复等完整工程链路,现已上线StreamLake平台开放API供开发者调用。

阶跃星辰推出面向手机、车载场景的「Step Edge」端侧模型全家桶

7月12日,阶跃星辰推出面向手机、车载场景的「Step Edge」端侧模型全家桶,包含基础、音频、GUI、图像生成四大模型,配套自研NPU推理引擎;全系在29项核心评测指标登顶,本地工具调用最低延迟0.1秒,支持多模态数据本地处理保护隐私,采用原生端云协同架构,简单任务本地运行、复杂任务交由云端,完善了阶跃端云协同AI模型布局。

腾讯混元推出1B参数端到端OCR大模型「HyOCR-1.5」

7月13日,腾讯混元推出1B参数端到端OCR大模型「HyOCR-1.5」并完整开源训练、推理与权重,依托DFlash投机解码实现最高6.37倍推理提速,借助Agentic Data Flow智能体数据管线补齐古文字、多语种、多图问答等长尾能力,搭配4K高分辨率、128K上下文与分层强化学习优化;该模型在OmniDocBench、古文字、低资源语种等多项基准拿下同参数SOTA,幻觉更少、无文字图误识别率大幅降低,支持服务器、笔记本本地部署,覆盖文档解析、图表识别、拍照翻译、字幕提取等八大类任务,为产业与科研提供轻量化、低成本可二次开发的文档智能底座。

商汤开源统一视觉大模型「SenseNova-Vision」

7月13日,商汤开源统一视觉大模型「SenseNova-Vision」,摒弃多模型拼接方案,将检测、分割、深度预测、3D重建等各类经典视觉任务原生融入通用多模态底座,依托跨任务知识互补实现性能提升,在稠密分割、空间几何、零样本跨域识别、抗反射与视觉错觉场景表现突出,多项评测指标全面超越Vision Banana等竞品,单模型综合能力对标专业专家模型;项目同步开源5000万规模视觉指令数据集,大幅降低多视觉任务开发部署成本,后续相关技术将整合进日日新U系列大模型。

清华Xmax AI推出虚实融合实时交互视频模型「X2.0」并开放商用API

7月15日,清华团队Xmax AI推出虚实融合实时交互视频模型「X2.0」并开放商用API,区别于行业内卷画质的路线,主打可实时操控的交互式视频,相比前代X1将画质升级至960p/24fps、实现毫秒级近乎零延迟,支持手势、触屏、文字等多模态联动交互,涵盖实时换人、换装、风格转换、触控、次元互动五大能力与自由文字模式;团队自研数据管线解决训练素材稀缺难题,支持移动端端侧实时推理,API调用成本远低于海外竞品,可用于直播、电商试穿、虚拟AR等场景,将单向视频变为可实时操控的交互载体。

千问正式发布实时语音交互模型「Qwen-Audio-3.0-Realtime」

7月15日,千问正式发布实时语音交互模型「Qwen-Audio-3.0-Realtime」,分强推理Plus版与极速Flash版,面向智能客服、教育、情感陪伴等场景,从推理能力、自主工具调用、共情语音、双工实时交互四大维度升级,依托在线策略蒸馏与多教师蒸馏技术实现毫秒级低延迟且推理能力不衰减,多项语音基准测试表现优异;模型可自主调用工具并留存上下文,能随语境变换情绪语调、模拟人声副语言,支持实时插话、嘈杂环境精准识别人声,适用于客服、教育、情感陪伴等场景,现已上线阿里云百炼。

腾讯开源6.2B具身认知基座模型「Hy-Embodied-RxBrain-1.0」

7月15日,腾讯RoboticsX联合混元开源6.2B参数具身认知基座模型「Hy-Embodied-RxBrain-1.0」,依托五万余小时具身数据训练,采用多模态混合Transformer架构,可统一完成文本推理与视觉目标想象,输出文字步骤+目标图像指导机器人动作;自研评测基准RxBrain-Bench显示其联合规划能力优于多模型拼接方案,短时世界预测效果接近专用世界模型,扩展动作分支后在多款机械臂实操任务平均成功率达87%,高于同类模型,整套模型完整打通场景理解、任务规划、状态预判到机器人实操的全链路,代码已开源。

Thinking Machines Lab发布自研多模态大模型「Inkling」

7月16日,OpenAI前CTO创立的Thinking Machines Lab发布自研多模态大模型「Inkling」并完整开放权重,采用混合专家Transformer架构,总参数9750亿,激活参数410亿,支持百万级上下文,配套轻量预览版Inkling-Small;模型依托45万亿多模态数据训练,采用创新MoE与注意力架构,经大规模强化学习优化,可自主调控推理强度,在智能体编程、音视觉多模态、安全防护等基准表现优异,支持Tinker平台便捷微调,兼容主流推理框架,同时开放多渠道API与Hugging Face权重下载,主打低成本定制化企业落地。

小米发布具身机器人基座模型「Xiaomi-Robotics-1」

7月16日,小米发布具身机器人基座模型「Xiaomi-Robotics-1」,依托10万小时多场景真实操作轨迹完成两阶段训练,验证了机器人领域存在Scaling效应,模型支持自然语言指令、开箱即可完成家居整理等任务,少量数据就能快速适配全新操作场景,在多项主流仿真基准刷新最优成绩,开辟了可规模化的具身智能训练路线,模型与代码后续将逐步开放。

月之暗面推出旗下最强模型「Kimi K3」,全球首个3万亿级别开源模型

7月17日,月之暗面推出旗下最强开源大模型「Kimi K3」,2.8万亿参数,是全球首个开源3万亿级别模型,基于自研KDA混合线性注意力、注意力残差架构与Stable LatentMoE稀疏专家框架打造,拥有100万Token超长上下文并原生支持视觉理解,整体性能仅次于Claude Fable 5、GPT-5.6 Sol,擅长长程编程、科研推理、多模态知识工作等场景,可独立完成GPU内核优化、自研编译器、芯片设计、科研复现、行业深度调研、视频动画制作等复杂长周期任务;现已全平台上线,7月27日前放出完整权重,API设有缓存优惠,该模型存在上下文易受干扰、自主行动过强、不及顶尖闭源模型等短板,后续将上线企业托管Agent平台。

AI Agent

斯坦福团队推出通用生物医学智能体「Biomni」并登上《Science》

7月10日,斯坦福华人团队研发的生物医学通用AI智能体「Biomni」登上《Science》期刊,它搭建涵盖海量专业工具、软件与数据库的虚拟实验室,依托自主资源筛选、代码执行、自适应规划三大核心架构,搭配强化学习持续迭代;在综合基准测试表现大幅领先普通大模型与细分领域专用AI,多项任务准确率比肩甚至优于人类专家且效率高出数十倍,可全自动完成可穿戴数据解析、多组学挖掘、基因克隆实验方案设计、蛋白稳定性优化、自动化实验设备代码生成等全链路科研工作,打通干湿实验流程,以人机协同模式大幅加速生物医学科研发现。

LibTV正式上线「LibTV Agent」,搭建全球最大的专业视频Skill Hub

7月14日,LibTV正式上线「LibTV Agent」,区别于仅拼接工作流的普通视频Agent,它主打成品级直出,3分钟内视频一次生成达标成功率超80%;平台搭建全球最大专业视频Skill Hub,上线百余套封装专业创作经验的导演级技能,覆盖广告、短剧、影视等赛道,支持用户调用或自研沉淀技能,并推出千万激励计划扶持创作者;同时具备分镜+工作流双视图创作、AI一体化剪辑能力,可通过自然语言持续优化画面、字幕、配音,一键产出多语种、多平台适配版本,适配各类专业视频创作需求。

金山办公发布个人端「灵犀专业版」与企业端「WPS Comate」

7月15日,金山办公AI生产力大会同步发布个人端「灵犀专业版」与企业端「WPS Comate」,「灵犀专业版」作为专属AI办公助理可依托WPS原生接口输出可编辑标准文档、表格、PPT;「WPS Comate」落地WPS 365“企业大脑”,依托“三通两管一平”体系打通企业数据业务系统,实现AI成本管控与数据安全,两款产品将于7月17日至20日亮相世界人工智能大会。

稀宇科技更新「MiniMax Code 2.0」桌面端,底层重构强化长任务

7月16日,稀宇科技推出重构后的「MiniMax Code 2.0」桌面端,基于开源框架Pi Agent重构底层链路,大幅提升会话启动速度与长任务稳定性,优化图表、文件预览编辑等功能;打通恒生、企查查数据上线金融分析模块,可自动完成产业链调研、投资报告等全流程工作,本月还将新增远程操控、浏览器控制等能力,现已开放下载。

昆仑万维升级SkyProduction推出「Agent智能分镜+无限画布」双轨模式

7月16日,昆仑万维天工短剧工作台SkyProduction推出「Agent智能分镜+无限画布」双轨模式解决传统AI短剧随机生成、角色漂移、成片不连贯等痛点,搭载Seedance 2.0、3D导演台、720°全景生成、可视化光影机位编辑等功能,支持英文出海短剧制作,配套企业级多账号权限管理与算力数据统计,实现可控、标准化、规模化精品短剧生产,后续还将接入多款主流视频生成模型迭代升级。

AI 工具

浪潮发布Agent专属液冷机柜与AI服务器,搭建规模化智能体完整算力底座

7月13日消息,浪潮信息推出业界首款CPU原生液冷整机柜服务器,单机柜可承载4万+智能体协同运行,解决多Agent调度高密度CPU算力与散热难题;升级元脑SD200超节点AI服务器,万亿大模型单Token延迟低至4.77ms,支持多模型并行融合部署,搭配企业版降低本地部署门槛;当下智能体任务CPU调度占比极高,算力架构从传统CPU-GPU配比重构,CPU集群负责海量Agent流程调度,超节点GPU提供低延迟模型推理,辅以元脑EPAI平台统一管控,形成适配多智能体协同、多模型组队的完整Agent基础设施体系,适配企业规模化智能体落地需求。

阶跃星辰发布智能体原生操作系统「Step AOS」及「STEPX Neo」终端手机

7月13日,阶跃星辰举办终端品牌与新一代智能体战略发布会,发布智能体原生操作系统「Step AOS」、基于Step AOS打造的智能体阶跃「Amoo」、以及大模型原生AI终端品牌「STEPX」。大模型原生智能体手机「STEPX Neo」也同场亮相。「Step AOS」由模型矩阵与Agent原生OS相乘构成,原生支持MCP、A2A、CLI协议,端云级联调度,试图打破能力、协作、资源三堵墙。

技术突破

银河通用发布全球首个面向具身大模型的测试时后训练框架「WAM-TTT」

7月16日,银河通用发布全球首个面向具身大模型的测试时后训练框架「WAM-TTT」,解决机器人新场景部署泛化衰减、数据采集成本高的行业痛点;该技术仅依靠无标注普通人类视频即可完成场景适配,无需机器人遥操作轨迹与人工动作标注,采用主干冻结+轻量内存模块微调架构,做到旧技能零遗忘、快速适配新环境;实测技能泛化保持率75.6%,大幅优于传统上下文学习ICL方案,低成本打通机器人预训练到实地落地全链路,支撑机器人规模化商用与技能商店模式落地。

市场动态

逐际动力发布搭载「COSA 0.5」系统的人形机器人Oli做家务Demo

7月15日,完成Pre-IPO融资后的逐际动力立马发布搭载「COSA 0.5」系统的人形机器人Oli,无剪辑长程自主做家务Demo,成为国内首个完成完整家庭多任务的全尺寸人形机器人,实操水平对标海外龙头Figure;其摒弃行业单一大模型路线,采用S2认知、S1技能、S0运控三层分层协同的具身智能操作系统架构,底层自研LimX WBT全身运动模型,动作精度、平滑度优于行业标杆,支持分层独立迭代、真机强化学习优化,同时开源训练引擎搭建开发者生态,依靠软硬件一体系统化方案形成差异化竞争优势。

Anthropic最新研究:Claude说话风格由语种决定,中文版本严谨爱纠错

7月15日消息,Anthropic发布研究论文,基于超30万段真实对话发现Claude的沟通风格受使用语言影响远大于模型版本差异;模型顺从、温暖、严谨等四大行为轴在不同语种表现分化,印地语、日语、韩语、泰语等语种下Claude更温和顺从、擅长共情鼓励,中文、英语、俄语等语种则偏向审慎严谨,中文Claude兼具纠错驳斥与温和安抚的混合特质,团队暂未明确该差异化表现的成因,推测和各语种训练数据体量、文本风格不均衡相关。

Your browser is out-of-date!

Update your browser to view this website correctly. Update my browser now

×