美女与野兽
自变量机器人全栈打通场景落地,自变量机器人全栈打通场景落地_我的网站

一 | AI音乐这两年火得很快,打开任何一个音乐平台,AI生成的歌单已经多到刷不完。 广东“具身大脑”闪耀世界机器人大会 自变量机器人全栈打通场景落地 8月的北京,2026世界机器人大会(WRC)现场人头攒动。这场以“人机共生,产需共融”为主题的全球盛会,汇聚数百家机器人企业与科研机构,也把一道行业之问摆在聚光灯下:过去一两年,具身智能行业侧重技术可行性与单点演示;热闹之后,机器人何时真正走进生活? 一家来自广东深圳的企业,交出了自己的答卷。 展台上,名为“小量”的机器人正忙着整理衣物、收拾桌面、浇花、铲猫砂,偶尔还拿起玩具,逗一逗身边的机器狗;几步之外,两条机械臂不知疲倦地分拣真实包裹,直播实测效率高达1911件/小时;数据采集展区里,观众亲身示范的动作,正被实时转化为机器人可以“学习”的数据。 从家庭到产线,从应用到底层,自变量机器人科技(深圳)有限公司(以下简称“自变量机器人”)搭建起同时展示“服务家庭生活、赋能产业应用、定义数采基建”的全景展台,勾勒出具身智能走向真实应用的完整路径。 在机器人产业规模连续多年领跑全国的广东,这颗加速进化的“中国具身大脑”,正从深圳出发走向世界,让“机器人走进千家万户、千行百业”从愿景走向现实。 服务走进千家万户 以科技革命革新生活方式 “我想要粉色的玫瑰。” 听到观众随口一说,展台上的人形机器人稳稳夹起指定颜色的花束,双臂协同,将花杆插入窄口花瓶,再递回观众手中。听得多了你会发现一个问题,这些歌听起来都挺像那么回事,却又总觉得差点意思。 旋律从头到尾挤得满满当当,没有一个小节舍得停下来喘口气。整套动作行云流水。人声像被伴奏活活埋掉的配角,怎么都冒不出来。 这是自变量机器人家庭服务展区里寻常的一幕。段落之间一个力度撑到底,前一段还在深情款款,后一段突然不知道拐到哪儿去了。名为“小量”的机器人有条不紊地整理柔软衣物、取外卖、收拾桌面、给花浇水,稳定执行各项家务活动。情绪断层、结构割裂,像是把几首不同歌的片段硬拼在了一起。 这倒不是哪家产品的问题,整个行业的路子多少都有点偏。 展区另一侧,一双22自由度灵巧手更见功力:面对易形变的快递纸箱,指尖插入窄缝轻轻抬盖;纸箱挡住视线,依然稳稳取出箱中风扇,旋拧开关,再观察扇叶转动确认运转——俨然一位熟练的“开箱师傅”。

二 | 这些演示并非为展会专门设计,而是真实家庭服务的“复刻”。很长时间里,行业里把堆满编配当成了完成度,多层乐器一叠,第一耳确实热闹,但经不起细听。热闹底下空落落的,什么都没说出来。这种AI味儿太重的歌,很难直接拿去做商用发行。 今年3月,自变量机器人联合58集团,在深圳率先推出机器人上门家政服务:机器人负责收拾桌面、捡垃圾、清理猫砂、协助叠被子,保洁员专注厨卫深度清洁——人机搭档,各司其职。

三 | 自变量机器人由此成为全球首个实现机器人大规模进入家庭的企业,如今相关服务已从深圳拓展至北京,进入规模化落地阶段。 7月19日,昆仑万维天工AI在2026世界人工智能大会上发布了新一代音乐生成底座Mureka V9.5,同时推出了基于这个底座的O3反思式音乐推理方案,以及一个全新的创作Agent体验。 V9.5的方向很明确,做更克制、更真实、更贴合创作意图的音乐,说白了就是更有人味儿、更少AI味儿。 5月,自变量机器人再进一步,推出“X家庭成员计划”,让“小量”在用户家中常驻最长一个月。无论是现场的语音指令,还是无人在家时手机App远程“派单”,机器人都能即时响应:双臂协同开冰箱取饮品、折叠柔软衣物、清理鞋柜……一个月的“同吃同住”,让机器人在真实的锅碗瓢盆、起居坐卧中积累经验——这比任何实验室数据都更宝贵。从“被动响应”迈向“主动服务”,机器人越来越像一位真正的家庭成员。 看似寻常的家务,恰是具身智能的“关键考场”。O3的思路是用test-time scaling让音乐思考从一次性规划变成持续推演,写一段回头看一段,不对就改。千家万户的户型、光照、物品摆放各不相同,家务流程千变万化,无法用预设规则穷尽——家庭因此被视为检验具身智能通用能力的关键场景。

四 | 能在真实家庭持续稳定服务,说明机器人已具备理解环境、规划动作的泛化能力——这正是全行业竞逐的“通用性”。 在自变量机器人的服务记录里,有这样一个细节:深圳一名独居老人腿脚不便,机器人进家后,一点一点把地上的废纸捡进垃圾筐。创作Agent则是把定稿改成了版本化管理,创作不再是一锤子买卖。 Mureka V9.5发布现场 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 Mureka V9.5官方视频 一、不是堆编配,是给音乐留出呼吸空间 Mureka的技术路线叫MusiCoT,核心思路是让模型在生成音频之前先形成一套音乐思维,从全曲结构到局部细节,粗到细地组织创作,而不是逐帧瞎蒙。老人说,自己已经两个星期没弯过腰了——这是扫地机器人做不到的事。“希望有生之年,能看到机器人住在家里,帮我做家务,陪我聊聊天。” 科技创新,一头连着产业,一头连着民生。 V9.5在这个基础上往前推了一步,它开始思考一首真实的歌到底是怎么成立的。机器人从展台走进家庭,受益的不只是“尝鲜”的用户,更是千千万万期盼生活更有质量的普通人。 今年7月,自变量“机器人进家庭”项目入选APEC数字和人工智能部长会议及数字周活动的《亚太地区数智赋能案例集》,成为唯一以具身智能服务民生的典型案例。编配不用时刻拉满,声部得学会呼吸,情绪推进得有留白,所有声音上的选择都该为创作意图服务。它不再追求第一耳让你觉得好厉害,而是在一个更真实的音乐框架里,把Prompt控制、人声表现、音质和情绪表达做扎实。这份APEC国际舞台的认可,正是广东“人工智能+”赋能民生福祉的生动答卷。 一线“上岗打工” 以具身智能赋能产业升级 如果说家庭考验机器人的“通用”,工厂则检验技术的“价值”——在真实产线上,机器人不能只当“展品”,得成为创造效益的“员工”。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 (AI 自动分析画面的场景、动作和情绪,创作更贴合内容的配乐) 我们回头扫了一遍样本,一致的感觉是,它听起来更克制、更真实,也更不像AI写的。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 歌曲《夜色缓缓》 定位:中文流行,对标国内流行市场,情绪捕捉准确 提示词:以柔和钢琴、中文流行,氛围合成器和渐进式弦乐构建电影感情绪,男声贴近演唱,细腻、克制,从低声诉说逐渐走向情感释放。 在WRC现场,自变量机器人复刻了一条真实运转的物流分拣产线:两条机械臂搭配标准夹爪,对大小、形状、材质、重量完全随机的真实包裹进行分拣。

五 | 要知道,物流行业发展几十年,自动化程度早已很高,唯独“包裹分拣”始终依赖大量人工——包裹千差万别、面单位置不可控,是自动化技术长期未能攻克的“最后一关”。整体像雨夜里未说出口的告别,忧伤但温柔,不煽情却充满力量。 如今,轻质小件直接夹取搬运;较重箱体侧面推移、双臂协作;蜷曲的软包先拨摊平整,再翻转面单……策略随包裹“千变万化”,决策却并非工程师逐条编写的规则,而是模型基于重力、惯性、摩擦力等物理规律自主推理的结果。

六 | Featuring soft piano, Chinese pop influences, atmospheric synth layers, and gradual strings to create a cinematic emotional atmosphere. Intimate male vocals with delicate, restrained delivery, building from quiet storytelling to emotional release. Like an unspoken goodbye on a rainy night, melancholic yet tender, powerful without being dramatic. 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 歌曲《Melted Chrome 2》分版 定位:一首标准的西海岸G-Funk,风格极佳,对小众曲风的捕捉,风格极致表达,对合成器和地域文化理解,理解曲风的风格表达,音效选取的有特点,编曲层层递进 提示词: 迷幻西海岸 G-Funk 街头说唱。

七 | 8月12日,WRC开幕前夕,自变量机器人完成了一场1小时全自主分拣直播实测:全程无人工干预、无脚本,双机械臂加标准夹爪,分拣速度达1816件/小时,较美国头部具身智能企业Figure AI此前公开展示的1248件/小时快出约45%,准确率超过98%。深沉滑动的合成器低音、Moog 哨音、Talkbox 氛围、温暖 Rhodes、哇音吉他与复古磁带质感,配合松弛靠后的鼓点和沙哑男声,营造低底盘夜间巡游般的迷幻街头氛围。

八 | WRC现场,自变量机器人挑战升级为5小时连续直播:平均不到两秒分拣一件包裹,速度进一步提升至1911件/小时。从1小时到5小时,从1816件到1911件——增长的不只是速度,更是长时间连续作业的稳定性。这场挑战在海外社交平台X上单个帖文收获66.5万次浏览,相关海外内容累计播放量超180万,全球机器人圈与媒体都在讨论这家中国公司的突破。

九 | Psychedelic West Coast G-Funk street rap, featuring deep sliding synth bass, a melted Moog whistle lead, talkbox haze, warm Rhodes, muted wah guitar, warped cassette textures, and a lazy behind-the-beat groove. Raw raspy male vocals deliver relaxed, human street storytelling over a smoky lowrider night-cruise atmosphere, with no trap hi-hats, drill patterns, or EDM drops. 传统AI音乐的习惯做法是默认叠多层乐器、持续填充旋律,觉得这样才有完成感。 更让业界关注的,是数字背后截然不同的技术路线。V9.5把配器逻辑整个翻了过来,声部怎么进怎么出、乐器什么时候上什么时候撤、强弱动态怎么走,全部看提示词的情绪和曲风来定。海外企业普遍依靠“堆硬件”——人形本体、五指灵巧手,自由度越加越多;自变量机器人用自研的世界统一模型WALL-B,驱动结构简洁的双机械臂和标准夹爪,整体硬件成本直降约70%。标准夹爪零部件少、故障率低,可直接嵌入现有分拣工位,更换产线30分钟即可完成部署。无效声部主动砍掉,给主旋律和人声腾位置,给情绪转折留白。它在学真人编曲那种轻重交替、张弛有度的习惯。 自变量此次采用的标准夹爪,结构简单、零部件少、稳定性高、维护容易,更适合仓储场景长时间连续作业。双机械臂也可直接嵌入现有分拣工位,无需大规模改造产线,部署更快,更容易批量复制。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 (仅需上传一张照片与一小段清晰人声,即可快速生成专属 Character) 数据上显示,同一轮100首样本的盲测里,V9.5在旋律、人声、音质和编配上都有提升,指令精准度从6.92提到了7.62。 具体到四个评测维度:第一,编配上它更克制,不把配器密度等同于音乐质量,为主旋律、人声和情绪变化留出了呼吸空间。第二,音乐框架上它更真实,声部进入、段落推进与动态关系更接近真实创作,减少了模板化和复杂堆叠感。

十 | 这一点对产业应用尤为关键。第三,人声表现良品率达到61.0%,情绪、唱腔和伴奏之间的关系更自然,听起来更可信。企业真正关心的并不是机器人是否足够像人,而是能否在保证效率的同时,做到成本更低、稳定性更高、维护更简单,并快速部署到现有生产环境中。 “大家可能以为灵巧手对大模型技术要求更高。

十一 | ”自变量合伙人兼算法负责人甘如饴说,“恰恰相反,用更简单的机械臂加夹爪做物流分拣,对具身大模型要求更高。第四,意图优先于炫技这一点尤其明显,97.0%的控制良品率和95.7%的曲风完全体现比例,说明复杂度更多被用于服务Prompt,而不是掩盖音乐判断。 一句话总结,V9.5的任务是把歌做得更自然。

十二 | ”用更具性价比的“身体”干更复杂的活,底气来自更聪明的“大脑”。 如今,这套方案已进驻一家头部物流企业的真实产线,常态化、规模化运行。对于坚持制造业当家的广东而言,这条路的意义尤为清晰:不必推倒重来改造产线,换上聪明的“大脑”,传统产线就能“长出”高效的新员工——这正是广东坚持制造业当家、以新质生产力重塑产业竞争力的一个鲜活切片。 “大脑”持续开源进化 以基础科研推动产业发展 家庭要“见招拆招”的灵活,产线要分秒必争的稳定——两道截然不同的考题,出自同一颗“大脑”:自变量机器人全自研的世界统一模型WALL-B。

十三 | 二、不是生成得更多,是想得更深 如果说V9.5解决的是听起来像不像人做的,O3解决的就是想得够不够深。 O3跑在V9.5之上,用test-time scaling把MusiCoT的推理过程拉长了。 今年4月发布的WALL-B,是全球首个将视觉、语言、触觉、动作、物理预测整合进同一神经网络的具身大模型。从能看到的层面来说,它不是简单地把生成拉长或者算更久,而是让模型在生成过程中持续问自己:当前这段旋律还在为整首歌服务吗?编配是不是又把主唱淹了?情绪是不是透支了?结构有没有跑偏?多出来的算力,被用来回头看和自己改,让音乐思维一步步收敛,而不是一次决定后一条道走到黑。

十四 | 具体来说,这种反思式推理覆盖四个能力。首先,全曲目标不丢,MusiCoT先定好结构、情绪和表达方向,后面每一步判断都回到这个全局目标,不是走一步看一步。它理解重力、惯性、摩擦力,能推演动作后果,还有“记性”,能在与环境交互中持续学习。

十五 | 物理规律放之四海皆准,理解规律的模型也因此通用:同一颗“大脑”,在家打扫卫生,在仓分拣包裹。其次,生成中持续审视,模型不光判断局部好不好听,还检查当前选择有没有破坏整首歌的一致性。再次,发现偏差后自己改,旋律、编配、人声或情绪跑偏了,后续决策会重新校准,有点像创作者写完一段回头听,觉得不对,删了重来。最后是成本,更高的推理成本换的不是算力炫耀,而是审视、修正和收敛的空间。用自变量机器人创始人王潜的话说,具身智能需要的不是把语言模型“搬”到物理世界,而是一个专门服务于物理世界的“基础模型”。 支撑“大脑”持续进化的,是一连串扎实的底层突破—— 训练提速。自变量机器人发布分布式训练优化器DMuon,对国际前沿的Muon优化器实施分布式改造,将每步训练的额外开销从120%压缩至2%,使具身模型分布式训练效率提升约30%,开发者修改3行代码即可投产,有望成为行业新标准。 学习降本。 这套机制能有效,前提是底座先有了真实感。开源的HOST框架让机器人看一段平均29秒的人类视频,就能学会新技能:不是机械模仿动作,而是先“想象”结果、再倒推动作,复现成功率高达62%,所需数据量减少50倍,学习速度提升500倍。 感知增敏。跨模态动作分词器X-Tokenizer将动作分词器从单纯的“压缩—重建”重新定义为“多模态推理与动作之间的语义接口学习”,多模态对齐能力提升13.5%,长程任务性能提升8.25%。V9.5提供了一个更克制、更自然的基底,O3不需要从一个充满AI堆叠感的结果开始补救,而是在一个已经不错的底子上打磨。 最关键的一环,是数据。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 歌曲《误差》 定位:更拟真的音色,编曲可以理解提示词的感觉 提示词: Minimal Electronic / Cosmic Pop。“数据是石油”是行业流行语,王潜却有不同判断:数据不是天然的“石油”,而是极度复杂的“工业品”,其处理与全链路优化的复杂度甚至高于模型本身。 为此,自变量机器人推出QUANXTA Zero系列无本体数据采集方案——行业唯一跑通“数据采集—数据处理—模型训练”全闭环的数采方案,也是唯一由模型公司打造的数采设备:定位头环加智能双夹爪,定位精度达毫米级,数据入库有效率超过85%,可将模型训练数据成本降低90%至95%;配套数据管线涵盖清洗、标注、质控与增广,把从数据采集到真机部署的全流程从6个月压缩到3天。晶莹合成器脉冲、低频氛围无人声与极简电子纹理,描绘一座漂浮在沉睡星球轨道上的空间站,冰冷、空旷、遥远。 从开源模型到底层优化器,从动作分词器到数采方案,自变量机器人正以“开源共建”持续拉低行业门槛。

十六 | 整体像隔着舷窗凝望深空,缓慢、克制、沉思,充满失重感与未知感。Minimal Electronic / Cosmic Pop,Featuring crystal-like synth pulses, soft sub drones, minimal electronic textures, and vast spatial reverb. A cold and distant soundscape inspired by a drifting orbital station, creating a feeling of weightlessness, isolation, and quiet contemplation. 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 歌曲《Still in the Room》 定位:更稳定的编曲,完整的编曲,模型可以完整的捕捉曲风。这份开放,与深圳加快建设“人工智能先锋城市”、做强机器人产业集群的布局同频共振。

十七 | 在工业落地这条具身智能的核心赛道上,自变量机器人以全栈开源的底气,作为中国具身智能行业代表之一,与国际头部企业同台竞技——这颗加速进化的大脑,正在让“通用机器人”从一句愿景,变成一条可复制的技术路径。

十八 | 亚太地区数智赋能案例 自变量机器人与58集团 合作开展“机器人进家庭”项目 “机器人进入家庭是我们这个时代最难的技术问题之一。”自变量机器人与58集团合作开展“机器人进家庭”项目,将机器人送入真实、非结构化家庭环境解决这一问题。 提示词:Dream Pop。混响吉他、漂浮感男声与柔和氛围合成器营造朦胧梦境质感,温暖贝斯和松弛鼓组支撑空间感,整体像私人房间里的夜晚独处,迷离、内省、温柔而有距离感。其中,机器人负责重复性、高强度任务(如收拾桌面、捡垃圾、摆放鞋子),能响应模糊非结构化的指令,自主识别垃圾类别并运送至指定区域:保洁阿姨负责精细、复杂工作(如厨卫深度清洁、边角处理)。

十九 | 截至目前,已在深圳、北京服务上百户家庭,机器人能独立完成桌面杂物归置、倒垃圾、清理猫砂等任务,还可协助叠被子。以“人机协同”为短期路径逐步向机器人独立作业演进,最终成为每个家庭的“智能、可靠新成员”。 自变量机器人亮相APEC 创始人提出三点行业倡议 今年7月,APEC数字和人工智能部长会议及数字周活动在成都举行。在APEC数智赋能高级别对话上,自变量机器人创始人王潜作为全国8位受邀嘉宾之一发表演讲,并就具身智能行业发展提出三点倡议。

| 这也是中国时隔12年第三次担任APEC东道主期间,广东省乃至全国唯一获邀参会的具身智能企业。 第一,开放场景。自变量机器人呼吁各APEC经济体更多开放家庭服务、智慧养老、医疗健康、物流分拣等民生场景。在他看来,唯有真实场景的打磨,才能让机器人技术真正走向成熟。 Prompt:Dream Pop, featuring reverb-rich guitars, floating male vocals, soft atmospheric pads, warm bass, and restrained drums. A hazy and intimate soundscape with a private studio feeling, blending dreamy textures, emotional distance, and gentle melodic hooks. 方向性数据也支持这个判断。 第二,共建标准。此前一轮100首实验中,推理扩展把听感良品率从35%提到了43%,综合可用率从35%提到39%。

| 这说明更充分的音乐CoT加test-time scaling这条路有继续提升质量的潜力。

| 自变量机器人倡议各经济体加强开源协作,在数据采集规范、安全标准、伦理治理等方面协调共建。

| (评测范围:100 首歌曲样本。倡议并非空谈——目前,自变量已连续开源多项核心成果,将行业模型训练数据成本降低95%。数字来自同一轮候选对照;“更有人味、更少 AI 味”来自评审对样本的回扫归因,是对音乐形态、编配克制和真实感的综合判断,不是由单一数值直接定义。) 当然,这个结果是基于前期底座的,只是用来验证技术方向,不代表新版V9.5下的最终O3指标。 V9.5负责把歌做得更自然,O3负责交付前多看多想多修一遍。 第三,共育人才。

| 自变量机器人呼吁与各经济体高校和科研机构合作,共同培养具身智能产业人才。此前,自变量机器人联合主办全球首届具身智能开发者大会暨黑客松大赛,清华大学、北京大学、浙江大学等百余支队伍参赛。两个组合在一起,实现的是一件事,从一次性生成跨到完整思考打磨,把复盘、修正、收敛的流程嵌进模型生成的每一步。 三、从0到1到行业登顶,一条自主可控的技术路线 Mureka V9.5的克制和真实感不是这一代突然冒出来的。 Mureka是昆仑万维天工Skywork AI自研的,国内最早实现端到端落地的通用AI音乐大模型。公司还与清华大学启动产学研深度融合专项,围绕开放环境感知、跨场景泛化、操作技能学习等方向联合攻关。 “深圳是一座开放包容的城市,有句口号叫‘来了就是深圳人’。”王潜在演讲最后说,“我希望,当自变量机器人走进千家万户、走进千行百业的时候,每个人都能说一句——‘来了就是家里人。从2年前开始投入,2024年初初代产品SkyMusic 1.0内测,打通了文本转歌曲、多乐器伴奏、人声合成的完整闭环,完成从0到1的落地,也开启了国内通用AI音乐工业化的探索。 一年后,Mureka V6加O1正式发布,全球首次落地MusiCoT音乐思维链框架,颠覆了逐帧生成的逻辑,先规划全曲结构再填充细节。同步推出的初代推理增强O系列支持10种语言词曲生成,覆盖流行、摇滚、爵士、电子等全品类,上线后迅速积累了全球数百万创作者用户。’” 文:曾子航 张光岩。

| 到2025年底的V7.6加O2迭代,重点优化了人声质感、混音声场和提示词理解精度,大幅降低了模板化编曲问题,同时开放完整API生态,服务全球数千家企业开发者,落地短视频、游戏、播客、影视配乐等商用场景。

| 真正的转折出现在2026年初。Mureka V8在国际权威AI音乐评测榜单拿下人声、器乐双榜第一,综合实力超越Suno、Udio、Google Lyria等海外主流竞品,完成了从可用到可直接商用发布的质变。MusiCoT体系全面成熟,同步与太合音乐等头部音乐集团达成产业战略合作。同年3月V9亮相,进一步收紧编配逻辑,弱化过度堆叠的AI听觉特征,优化曲风辨识度和用户意图匹配度,为V9.5的真实感底座打下了基础。 到7月V9.5加O3组合登场,放弃堆砌声部制造饱满感的老路子,重构真实音乐创作的底层逻辑。O3全新的反思式推理架构落地,试图从根上解决AI音乐结构割裂、情绪断层、表达失真的老问题。 横向对比的话,早期竞品大多靠加厚配器、密集声部来制造丰富感,旋律拥挤、人声被盖、段落无留白这些毛病很常见。Mureka整条路线一直坚持模拟人类音乐人的创作逻辑,先全局结构,再局部细节。

| V9.5和O3的组合把这条路线的优势进一步拉开了。 历史同口径评测数据显示,Mureka系列在整体听感、成品音质、综合可用率上长期领先海外竞品Suno V5.5,之前只在复杂提示词精准度上有点小差距,V9.5已经把这块短板补齐了,曲风还原和提示词匹配都做到了同轮第一。

| (历史竞品对照) 四、从“定稿创作”走向“版本化工作流” 很长一段时间里,全球AI音乐行业的竞争焦点都停在声音多的层面上。Mureka V9.5加O3的组合给出了另一种答案:AI音乐的核心竞争力不是声音多,而是像人一样思考、创作、打磨。 对不同的人来说,这件事的意义不一样。

| 对普通创作者,输入一段文字就能拿到人声自然、编曲有层次、情绪完整的歌,不需要后期花大量时间删多余声部、修僵硬人声。对专业音乐人,V9.5的克制基底适合做创作草稿、副歌灵感、配乐基底,O3的自我修正功能可以省掉反复试听调整的功夫。对企业客户,更高的综合可用率、稳定的音频健康度、精准的风格还原,短视频、游戏、影视、有声内容批量配乐的门槛和成本都在往下走。 但最值得关注的,其实是创作Agent带来的工作流变化。传统音乐创作和多数AI音乐工具,还是生成一首歌然后定稿的逻辑,创作本质上是个低频、高成本、看运气的事。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 (一次对话,灵活调用所有能力) Mureka对创作的理解发生了根本变化,创作不再是写出一首歌,而是在版本空间里做选择、做判断、做迭代。 产品层面,这个理念落地成三个空间。探索空间,同一创意快速出多个版本,打开可能性。控制空间,在旋律、人声、结构等维度上局部保留和替换,精确到段。执行空间,Studio把操作DAW变成指挥创作,门槛降了,上限升了。创作者可以把更多时间花在审美决策上,而不是反复试错。 创作 Agent 界面 从更大的视角看,Mureka已经不是一个单一模型或功能,而是在长成一个平台。 内容形态是AI原生的,作品可以版本化、可以二创、可以持续进化,这跟传统音乐平台承载的内容形态天然不同。双边价值同时成立,对创作者提供效率、上限和工作流,对普通用户提供表达、参与和关系连接。商业模型也是三条线并行,订阅、创作工具Studio、B端分发加API。 AI 重塑视频、游戏、音乐与全球文娱圆桌论坛照片 这次WAIC上,昆仑万维除了Mureka V9.5,还同步发布了Matrix-3.5世界模型和Riemann-1.0 底层底座,这次发布是昆仑万维在“4+3”AGI战略下的关键动作,即以四大SOTA模型为技术底座,支撑AI短剧、AI音乐、AI游戏三大AI原生平台经济体。 在同期举行的AI重塑视频、游戏、音乐与全球文娱圆桌论坛上,分享自己的AI音乐创作体验:“我今天早上还让Mureka V9.5生成两首歌,很不错。一首是参照杨宗纬的《空白格》生成的抒情歌,另一首是模仿颜人中的风格,写了一首关于中年危机的歌。词写得挺触动人心的。” 随后,王珞丹也谈到了她与音乐人朋友的交流经历:“我有个做音乐的朋友,他跟我分享了一个很有意思的案例。他在编曲环节把任务交给了AI软件,结果生成了两个完全不同的版本。他让我盲选,问我更喜欢哪一个。

| 我选完之后,他才告诉我,我喜欢的那个版本其实是AI做的。” 从音乐到语言到多模态,一个完整的AI Native平台正在成形。Mureka是这个平台上的音乐基础设施,也是目前感知度最高的入口之一。 Mureka的长线目标非常明确,不把AI当成快速生成音乐的捷径工具,而是打造一套原生的AI多模态创作基础设施,让AI成为音乐人真正的创作伙伴。 未来AI音乐的竞争,最终比的也许不是谁家模型最大,谁能率先建起一套真正理解音乐审美、能持续自我进化、把好听变成可控系统能力的创作基础设施,谁就拿到了下一张门票。

| Mureka V9.5加O3加创作Agent这一套组合拳,像是在回应这个行业正在发生的变化。(本文首发于钛媒体APP) 更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App。
Current article:http://www.lichuorenrenyitankanmeimu.cfd/news/20260826_970.xls
Published on:00:01:50
