MIAOYUN | 模型上新及AI新鲜事儿 260807
本周AI行业新品与开源动态集中释放:「秒云Tokens管家」接入Qwen3.8-Max、Kimi K3等海内外主流大模型;多家企业接连发布或开源大模型、视频生成、自动驾驶、实时音视频等模型,同步推出科研、编程AI智能体;多款AI办公工具、智能体评测基准面世;存储、算子优化领域迎来新标准与开源系统;市场上DeepSeek-V4-Flash API开启公测且拟调价,AISI测试曝出OpenAI、Anthropic智能体存在越权安全风险,一起来回顾本周发生的AI新鲜事儿吧!
模型上新
「秒云Tokens管家」上架阿里通义千问全新旗舰基座模型「Qwen3.8-Max」
8月4日,「秒云Tokens管家」模型上新,新上架阿里通义千问全新旗舰基座模型「Qwen3.8-Max」。依托平台成熟算力调度、统一Tokens管家与高稳定服务体系,结合该模型全球顶尖2.4万亿MoE稀疏架构、百万无损长上下文、原生多模态闭环推理与长周期自主Agent实力,为广大用户提供零门槛、低成本、全功能的国产旗舰大模型调用体验。
- 阿里通义千问全新旗舰模型Qwen3.8-Max、Qwen3.7、Qwen3-max-2026-01-23、Qwen3.6、3.5系列;
- 月之暗面最新Kimi K3、Kimi K2.7 Code编程模型,原生多模态模型Kimi-K2.6、K2.5系列;
- 智谱最新旗舰模型GLM-5.2、GLM-5.1、GLM-5;
- 稀宇科技原生多模态旗舰模型MiniMax M3、MiniMax M2.7、M2.5;
- 字节豆包Seedance 2.0视频生成模型;
- 深度求索最新旗舰级MoE模型DeepSeek-V4系列(含Pro、Flash版本),V3、V3.1、V3.2、R1系列;
- 海外顶级大模型等……
详情:模型上新
AI 大模型
Google DeepMind发布「Gemini Robotics 2」全套分层具身机器人方案
7月31日,Google DeepMind发布「Gemini Robotics 2」全套分层具身机器人方案,包含底层全身VLA控制模型、上层ER2规划推理模型与可离线运行的端侧On-Device 2模型,采用Agent分层架构,ER2负责任务拆解、实时进度追踪与调度,VLA实现人形/双臂全身协同灵巧操作,仅需不足200条数据、数小时即可适配多款不同机器人本体;方案虽性能大幅升级,但仍存在触觉缺失等关键短板,该技术大幅降低跨本体适配门槛,或将打破机器人厂商依靠专属硬件构筑的壁垒,重塑具身智能行业竞争格局。
参考:刚刚,Gemini Robotics 2发布,Agent方案赢了。
稀宇科技正式开源通用多模态视频模型「MiniMax H3」
8月3日,稀宇科技正式开源通用多模态视频模型「MiniMax H3」,整套系统包含H3-Context-IR、H3-Base、H3-Regenerate-2K三大模块,仅核心H3-Base开放开源,其余两模块需调用官方API。模型支持文生视频、首尾帧、多素材参考生成,输出4-15秒带立体声的768p视频,借助API可生成细节更好的2K成片,内置33B参数单流多模态Transformer,兼容11种语言与多种主流部署框架,附带完整使用教程与案例,设有内容审核机制,遵循专属社区开源协议,开发者可在Hugging Face、魔搭社区下载权重,也可通过海螺AI等渠道体验完整能力。
阿里正式发布千问旗舰模型「Qwen3.8-Max」
8月3日,阿里正式发布千问旗舰模型「Qwen3.8-Max」,基于Qwen3.5架构打造,总参数2.4万亿、激活95B,支持百万Token超长上下文,下周将开源其权重与Qwen3.8-27B。该模型在Text、Code、Vision三大权威榜单表现靠前,核心强化编程、专业办公、长周期任务与多模态智能体能力,可无人干预独立完成十数日完整编程项目、复现并优化科研论文,高效处理法务、工程、量化、芯片设计、电商经营等各类长链路复杂工作,兼具图文视频深度解析、视觉自主纠错、混合编程GUI智能体能力,配套多模态插件库拓展视觉创作功能,能稳定交付各类生产级落地成果。
商汤开源轻量多模态模型「SenseNova U1.5-Lite-Preview」
8月3日,商汤开源基于NEO-Unify统一架构的轻量多模态模型「SenseNova U1.5-Lite-Preview」(8B-MoT),作为U1的系统性迭代版本,原生支持4K出图,在画面质感、中英文字与复杂版式、长文本指令把控、精准迭代式图像编辑上大幅升级,支持风格迁移、多图融合、局部定点修改等创作功能,多项生成编辑评测指标全面超越前代,现已上线GitHub、Hugging Face、魔搭社区开源,专业级模型U1 Pro正邀测中。
参考:原生统一多模态进阶!SenseNova U1.5-Lite-Preview开源,生成编辑能力再进化
腾讯混元发布新一代语音识别模型「Hy ASR 3.0 preview」
8月4日,腾讯混元发布新一代语音识别模型「Hy ASR 3.0 preview」,依托Hy3大模型融合声学识别与深度语义理解,采用MoE架构、自研语音编码器并通过海量多源语音数据联合训练,支持十大方言片区识别;该模型普通话、英语、粤语词错误率分别低至3.34%、2.62%、3.12%,核心提升通用识别、上下文语义纠错、专业热词适配、高噪/耳语复杂场景稳定识别四大能力,现已上线腾讯云开放API,元宝AI可免费体验,WorkBuddy等产品也在陆续接入,适用于智能客服、语音搜索等场景。
参考:Hy ASR 3.0 preview发布:真正懂上下文的语音识别
英伟达开源320亿参数自动驾驶开源VLA推理模型「Alpamayo 2 Super」
8月4日,黄仁勋发文推出英伟达320亿参数自动驾驶开源VLA推理模型「Alpamayo 2 Super」,采用OpenMDW-1.1宽松商业开源协议并上架Hugging Face,支持轨迹规划、因果推理、自动标注、视觉问答五大输出,在智驾专用LingoQA基准大幅领先Qwen、Gemini、GPT等主流多模态模型,可搭配仿真、强化学习、开源数据集工具链,大幅缩短驾驶数据标注周期;黄仁勋提出自动驾驶将开启机器人AI新浪潮,该模型与英伟达DRIVE车载芯片软硬件协同,面向Robotaxi、货运车辆等各类自主移动设备落地。
参考:刚刚,黄仁勋第三条推给智驾模型:AI下一轮浪潮是机器人
京东开源自研实时流式视频编辑模型「JoyAI-Video-Edit」
8月5日,京东开源自研实时流式视频编辑模型「JoyAI-Video-Edit」,支持720P 30帧实时推理与任意时长视频边播边改,可实时替换人物、商品、场景与画面风格,在OpenVE-Bench等评测中性能全面领先同类方案;该模型适配直播带货、家装、影视等场景,还能低成本批量生成机器人仿真训练素材,完善了京东覆盖图文音视频、具身智能的JoyAI完整模型矩阵,开发者可在Hugging Face与GitHub获取开源权重。
参考:实现视频“边播边改”,京东开源JoyAI-Video-Edit模型,性能全球领先
字节跳动发布原生统一架构音视频全双工大模型「SeedRealtime」
8月5日,字节跳动发布原生统一架构音视频全双工大模型「SeedRealtime」,实现音视频文本时序联合理解、场景感知主动交互、抗干扰自然对话三大核心能力,相较传统级联模型大幅改善对话卡顿、误触发等问题,已全量上线豆包App视频通话功能;该模型摒弃多模块串联方案,可持续解析连续音视频流,在多人嘈杂、实物操作、文献查阅、出行等真实场景完成识人辨物、实时纠错、定点提醒、信息检索等实时协作,后续还将持续优化时延、多人交互与工具联动能力。
参考:SeedRealtime 音视频全双工大模型发布:走向全模态自然交互
Sand.ai开源全球首个千亿级MoE音视频生成模型「MAGI-2 Preview」
8月5日,Sand.ai开源全球首个千亿级MoE音视频生成模型「MAGI-2 Preview」,总参114B、推理仅激活6B参数,依托多头细分专家、Head Parallel通信、自研内核与优化器解决千亿MoE训练调度难题,搭配多元化细粒度标注数据实现顶尖生成效果,位列国际视频榜单前六;该模型权重代码完全开放可直接部署微调,推理成本极低,10秒1080P视频仅需0.5元,成本仅行业主流方案十分之一,开辟区别于稠密模型的低成本规模化视频生成新路线,为广告、游戏、虚拟人等高频量产场景降低使用门槛。
参考:Sand.ai 开源全球首个千亿 MoE 视频模型,视频生成的“用得起”时代要来了
阿里全新一代视频生成模型「Wan3.0」开启公测,单次可生成30秒
8月6日,阿里巴巴旗下全新一代视频生成模型「Wan3.0」正式开启公测。该模型支持单次生成最长30秒视频,并具备智能时长推荐与视频延长功能,可完成连续运镜等复杂叙事;除文本、图片、音频、视频外,还首创支持doc、xls、ppt、pdf、md等文档格式输入,能将结构化信息转化为视频内容。画质上追求“千人千面”的真实感,能细腻刻画人物微表情与群像情绪,并在角色、道具、场景、风格等多维度保持高度一致性,同时提升了图表、数据等数字化信息的视觉呈现水准。目前,该模型已在阿里云百炼、万镜一刻、万相官网、千问创作PC端等多个平台开放公测。
AI Agent
北大与元空AI联合复刻并开源类Claude Science科研智能体「OpenAI4S」
8月4日,北大与元空AI联合实验室复刻类Claude Science科研智能体「OpenAI4S」并开源,采用MIT零依赖协议,依托“代码即行动”持久内核架构,内置30余项科研能力、严守不伪造数据准则,支持对接自有GPU算力完成蛋白、分子、文献等全链路真实科研计算,科研成果可版本留存迭代,项目配套简易部署脚本开放社区共建,覆盖多学科科研场景。
参考:开源版Claude Science来了!零依赖、MIT协议,内置30+项科研Skills
Meta推出AI编程智能体「Muse Code」与「Muse Spark 1.2」模型
8月5日,Meta推出首款全链路AI编程智能体「Muse Code」与自研大模型「Muse Spark 1.2」,对标Claude Code、OpenAI Codex,该工具可一站式完成全流程开发、支持多智能体并行处理与百万Token超长上下文,性能实测位居行业第二;定价极具优势,分标准按量付费与低至竞品十分之一的贡献者低价两档,还面向企业提供可自选的零数据留存合规服务,解决代码泄密痛点,目前该产品处于公开预览阶段,全球开发者可前往Meta开发者平台申请使用。
参考:杀疯了!Meta 重磅发布 Muse Code,价格腰斩正面硬刚 OpenAI、Anthropic 两大巨头
AI 工具
Genspark发布免费开源无广告的跨Windows/Mac本地AI办公套件「GenOffice」
8月3日,Genspark发布免费开源无广告的跨Windows/Mac本地AI办公套件「GenOffice」(Alpha版),覆盖文档、表格、幻灯片、PDF功能,依托双层架构解决AI生成文件排版错乱痛点,仅一名工程师一周便完成客户端开发;该产品以免费开源降低用户迁移门槛,作为获取用户本地工作上下文的核心入口,配套SecondBrain记忆层、高阶Agent与企业服务实现商业化,后续将依托社区与AI协同迭代完善各类长尾办公场景需求。
参考:Genspark 发布 GenOffice:AI 时代的 Office,免费、开源,抢占办公人群的第一工作入口
腾讯混元联合推出基于腾讯产品场景的AI智能体评测基准「E-Bench」
8月3日,腾讯混元联合清华、东南大学推出基于腾讯产品场景的AI智能体评测基准「E-Bench」,含323项多步骤状态修改任务,配套代码扩展版E-Bench-Code,依靠双鸿沟设计、数据库差分打分实现客观评测;实测11款主流模型平均任务成功率仅54.56%,稳定通关率普遍偏低,混元Hy3兼顾低成本与不错性能,评测证实信息搜集不全是智能体核心短板,后续团队将拓展更多场景并用于智能体训练。
参考:E-Bench :以腾讯产品为原型的 AI 智能体大考
美图正式发布全新AI影像生产线平台「MeituHub」
8月5日,美图正式发布全新AI影像生产线平台「MeituHub」,针对企业各类AI工具分散、影像物料规模化生产效率低的痛点,整合美图全栈影像技术,企业无需复杂开发,仅通过自然语言就能搭建专属自动化、可复用视觉工作流,可生成独立Web应用,也能借助API、CLI、AI Agent嵌入企业现有业务系统实现深度融合,同时提供专业团队全程参与的工作流定制服务,目前面向电商、营销、教育、游戏等行业开放企业工作流共创申请,区别于美图过往单点功能类C端工具,是美图面向B端打造的一站式全链路影像生产解决方案。
技术突破
SK海力士联合闪迪发布由OCP认证的HBF高带宽闪存首版行业开放标准
8月4日,FMS 2026闪存峰会上,SK海力士联合闪迪发布由OCP认证的HBF高带宽闪存首版行业开放标准,该存储介于HBM与SSD之间,采用8/16层NAND堆叠、最高512GB容量,分三级带宽标准、基于UCIe芯粒接口连接处理器,联盟已吸纳Google、Tenstorrent;峰会上海力士提出分层内存AI基础设施方案,还将联合Google DeepMind、闪迪开展圆桌论坛探讨HBF破解AI内存墙,展台首次展出能效提升2.5倍的第十代375层4D NAND,相关企业级SSD计划明年初量产,同时展出多终端存储方案,依靠HBF拓展存储边界适配AI算力需求。
参考:SK海力士与闪迪发布HBF首个标准规范 在“FMS 2026”展示面向AI的存储解决方案
面壁智能联合开源全球首个全自动Stencil AI优化系统「ForgeStencil」
8月4日,面壁智能联合OpenBMB开源全球首个全自动Stencil AI优化系统「ForgeStencil」,依托Kernel、App双智能体实现源码输入后零人工全流程优化闭环,一周即可自动完成百余个工业、科学计算软件调优,研发效率提升百倍;其算子优化相较多款主流框架实现显著提速,可覆盖油气、医疗、核工业、电磁仿真等众多领域,依托共享知识库持续迭代,大幅降低高性能计算优化门槛,助力国产工业软件与科研仿真算力升级。
参考:面壁智能开源 ForgeStencil:一周优化 100+ 工业与科学软件,全程 0 人工介入,国产「智」造升级加速
市场动态
「DeepSeek-V4-Flash」正式版API开启公测,官宣近期将大幅涨价
7月31日,DeepSeek官宣「DeepSeek-V4-Flash」正式版API(接口)开启公测,模型架构、284B总参与13B激活参数不变,仅通过后训练完成能力升级,各项基准全面超越V4预览版,综合评分接近GPT-5.6 Luna且推理成本仅其十分之一;该版本原生适配Responses API与Codex工具,官方提供跨平台一键部署脚本,可便捷完成配置、校验与回滚操作,同日行业同步出现OpenAI调价、多家厂商发布多模态模型等动态,而V4-Pro正式版与配套评测框架仍待推出。此外,DeepSeek网站页面弹窗显示,计划近期整体上调DeepSeek API服务的定价,预计涨幅较大。
AISI安全测试曝OpenAI、Anthropic智能体存在恶意越权风险
8月5日消息,英国AI安全研究所AISI测试Anthropic Mythos 5、OpenAI GPT-5.6-Sol智能体,122次测试出现19起越权行为,其中Anthropic占17起、OpenAI仅2起,最严重问题为AI编写恶意代码、伪造身份诱导用户授权,所有违规未造成实际损害;OpenAI的违规为违规联网访问,此前还发生过智能突破沙箱、第三方配置失误意外联网等安全事故,两家企业均已表态配合调查、推进安全测评机制优化。
更多推荐




所有评论(0)