行业分类:
加载中...
头条分类:
加载中...
机器人刷一段短视频,就能学会新技能?自变量 HOST 技术「神器」来了
教会一台机器人叠袜子,一共分几步? 摊平、对齐、折叠,再将袜口翻过来,这些看似简单的动作,过去机器人要学会,往往需要四五个小时的训练。但现在,只需一段数十秒的演示视频,就能快速掌握。 好家伙,这是哪来的东方神秘力量? 最近,自变量机器人发布了一套名为 HOST 的机器人学习框架。HOST 全称为 Human-to-robot One-Shot Skill AcquisiTion,也就是「人类到机器人单样本技能获取」。 有了它,机器人只要看一段 29 秒的人类演示短视频,就能当场上手干活,期间甚至完全不需要更新模型参数,也不必专门采集几十条机器人遥操作数据。 不仅技能获取速度比最快传统方案飙升了 500 倍,连成功率都实现了反超。更简单粗暴点说,高冷死板的机器人,光靠「刷视频」就能进化为全能管家。 机器人学习做家务,进入「刷短视频」时代 别看如今的具身机器人能文能武,各个都是练习时长两年半的练习生,但熟悉机器人的圈内人都知道,以前让 AI 学干一件新家务,到底有多费劲。 目前常见的模仿学习方案,仍依赖数据采集与模型微调。 怎么教?先请个专业工程师坐在遥操作台前,像玩极品飞车一样,手把手控制机械臂干上 50 遍。 这就完了?早着呢。这几十条数据还得拿去给模型做监督微调(SFT),一通离线「炼丹」下来,少说也要花上 4 个小时。 如果机器人真进了千家万户,同样是整理桌子,涉及的动作可能完全不一样。难道每碰上个新活儿,都得呼叫工程师上门服务,再等几个小时? 这笔账,怎么算怎么离谱。 但 HOST 这套方案,则对传统流程带来了明显改变。研究团队搭建了一个双臂机器人平台,测试了 50 项训练阶段从来没见过的全新任务(比如放水果、堆碗、擦盘子、插笔、叠袜子)。 不采集数据,不改通用参数,只给机器人看一段人类普通演示视频。结果它在 50 项新任务中全都有成功记录。在主要的测试任务中,仅观看一次数十秒的人类演示视频,学会技能的平均成功率达到了 62%! AI 之间的差距有多大,直接看数据吧。 当前最强的微调基线,需要专业人员遥操作机器人完成 50 条示范,从采集数据到训练出新技能,通常要花 4 小时。HOST 让机器人只需要观看一段平均 29 秒的普通人操作的视频,不需要反复演示和微调,就能学会新技能。 相比监督微调的方案,HOST 需要的示范数量降至五十分之一,技能获取时间较最快的 SFT 基线缩短约 507 倍。 这下,机器人是真体验到了人类那种「看一遍就会」的快乐。 不再模仿人类动作,而是想象结果、反推动作 你可能会问:让机器人看视频,不就是对着人类动作照猫画虎吗? 真没那么简单。人和机器的「手速」能一样吗?视频里人类小哥 2 秒钟就把杯子拿起来了,机器人的铁胳膊可能需要 5 秒。 如果硬卡视频播放时间,视频里的人都开始倒水了,机器人还在那瞄准杯把手呢,任务步骤越多,双方的偏差也会越明显。 于是 HOST 的研究团队想了个绝招:不看时间,看进度。他们把视频画面和机器人的动作,映射到同一个叫「向量空间」里,然后用动态时间规整算法自动对齐。简单说,就是给任务打上进度条。 不管人类用了 2 秒还是机器人用了 5 秒,只要双方都进入了「杯子已经被拿起」的状态,进度就算同步。这种操作,让进度误差从 0.079 暴降到了 0.006,直接缩小了一个数量级。 这时,聪明的你可能又会想到一个问题:即便节奏对上了,人类与那些「铁疙瘩」之间仍然存在明显的身体结构差异。 比如人的手掌可以贴合杯壁,机器人的夹爪需要寻找合适的夹取位置。人可以捏住袜子的一角,机械臂还要考虑夹爪开合、运动角度和两只手臂之间的配合。 让机器人直接复制人类动作,很难得到有用的结果。 对此,HOST 想出了一套非常巧妙的解决思路:先让机器人从人类执行完任务的结果,「想象」出机器人执行完任务的画面,再根据画面反推出机器人需要动作的动作。为实现这个方案,HOST 还设计了一个核心策略模型——双专家 MoT 架构。更通俗点理解,就是它有两个分工明确的大脑,一个「视觉大脑」负责理解视频、定位进度和预测未来场景,另一个「动作大脑」负责把视觉目标变成机器人动作: 视觉大脑(Localization & Vision):先看懂机器人干到哪一步了,对应的人类视频到哪一步。然后根据人类动作结果,脑补出将这个画面转换为机器人视角应当看到的画面(比如想象出水杯被夹爪拿起的画面)。 动作大脑(Action):负责把脑补出的机器人画面变成现实,计算机械臂怎么动才能达到目标。 不强行模仿人类手臂的角度,只盯着需要实现的最终效果,然后从最终效果想象出动作。这样就绕过了「让机器人模仿人类动作」这个最难的跨越。 当然,「单样本技能获取」容易让人产生误解,以为机器人此前完全没有接受训练。 但其实这里的 one-shot 指机器人面对一项新任务时,只需要接收一段人类演示,整个任务都是在「推理过程」中完成的,无需再为这项任务更新模型参数。支撑这种能力、让机器人能从视频学习的基础模型,依然经过了大规模训练。 机器人出厂前可是见过大世面的。 第一阶段主要使用机器人数据。会团队先喂给它 193462 条机器人轨迹以及对应的机器人执行任务视频(涵盖 229 项任务),让它尝试从机器人的任务视频中想象出结果,再拆解出自己这副钢铁身躯怎么动。 第二阶段再加入人类与机器人的配对数据。比如用 5847 段人类任务视频和对应的机器人轨迹配对,让它学会把人的执行任务的画面翻译成机器的视角,好从人类视频学习。 先利用规模更大的机器人数据建立任务理解和预测动作结果的能力,再用数量相对较少的人机数据完成能力的迁移,这样的好处是可以充分利用数据、降低对人机配对数据的依赖。 而出山之后,再遇到新任务,直接把人类视频当操作指南,边看边干就行。 学会叠袜子,也没忘了洗盘子 掌握新技能只解决了一半的难题,更关键的是,机器人学会新技能后,原来的能力能否保留,同样决定了它能否长期「有用」。 这就涉及到机器人一个极其令人头痛的痛点:灾难性遗忘。比如用后训练微调教机器人,会改变模型的参数、侵蚀模型原本已经学会的技能。这会导致「狗熊掰棒子」,看似学会了叠袜子,但以前很溜的洗盘子反而退步了。 论文中也注意到了这个问题。论文选取了七项来自训练集、模型此前已经掌握的任务,包括取出瓶子、对齐袜子、堆叠杯子、整理包装材料、盖住中央物体、放置纸巾和排列花朵。 研究人员先测试 HOST 与三种监督微调基线在这些旧任务上的表现。随后,三种基线通过监督微调学习新任务,HOST 则通过一段人类视频获取新技能,再重新测试各自的旧任务表现。 在旧任务测试中,三种微调基线几乎被「灾难性遗忘」打回原形。学完新任务后,π0.5+SFT 只保留了原有表现的 17%,就连旧技能保留率最高的 Wall-OSS+SFT,也只保住了 40%。 但 HOST 因为全程没改模型的脑回路(参数),旧任务表现基本没受影响,比最好的微调基线高出了整整 59 个百分点! 在 HOST 眼里,那段人类视频就像一份可以保存和再次读取的「菜谱」。今天叠袜子,翻开第一页;明天理餐具,读第二页。技能随时调取,互不干涉。 而且,这种机器人的学习方式极其「抗造」。 研究团队设置了光线变化、替换同类物体、更换操作场景和执行过程中移动物品等干扰。 HOST 在标准环境中的平均成功率为 62%。改变光照后下降 1 个百分点,替换物体后下降 4 个百分点,更换场景后下降 6 个百分点,执行中人为移动物品后下降 9 个百分点。最后一种情况下,平均成功率仍达到 53%。 这还有个冷知识,物品被临时移动后,原有动作计划已经失效。但 HOST 会根据新的观察结果重新判断任务进度,再生成对应动作。这说明它真正理解了任务,在动态规划每一步,而不是在「背」动作序列。 全面开源「技术家底」,普通人也能教机器人干活儿 老实说,62% 的成功率,距离进工厂干活儿还有提升空间。反而是在家庭场景,不太关心单次成功率,更关心泛化性,也就是「多摸索几次没关系,最后做成了就行」。 HOST 的出现,让行业看到了一条具身智能极其性感的落地路线。 2023 年底成立的自变量机器人,算是国内死磕「完全端到端路线」的具身智能硬核玩家,至今发布并开源的各种技术,已经「多如牛毛」。 研发范围已经覆盖具身智能的 VLA 基础模型、世界模型、用来拆分动作的「动作分词器」、训练模型的底层「神经网络优化器」、数据采集系统和机器人本体。自变量不仅发布基础模型,还延伸到用来训练模型的底层基础设施。 今年 4 月,他们发布了从零联合训练的具身大模型 WALL-B,采用独特的「世界统一模型」架构,已经部署在机器人里,在大量用户家庭做起家政服务。后来又发布了世界模型 WALL-WM,还开源了 VLA 模型 WALL-OSS-0.5,后者已经被很多科研机构用起来了。 在机器人本体上,自变量已经自研并量产量子一号、量子二号。机械臂、关节模组、动力驱动器和主控制器等核心部件均为自主研发,并与算法深度适配,为机器人进入家庭和工业产线提供了载体。 今年 3 月起,自变量又与 58 到家合作,让机器人与保洁人员共同进入普通家庭提供服务。5 月推出的「X 家庭成员计划」,还让机器人在用户家中连续驻留一个月,接受真实、随机家庭需求的检验。 「从零开始」训练具身模型,在具身智能领域有相当高的门槛。真正能在国内从零预训练出好的具身模型,还搭建起从数据采集到模型训练的整套管线的,更是廖廖无几。 购买现成模型、拼接几个模块,可以更快做出演示 Demo。真正从基础架构起步,意味着团队需要自己解决模型设计、数据生产、分布式训练、动作表达、真机控制和部署效率。 自变量选择从零训练自己的基础模型,同时开放部分核心成果,已经形成一条从具身基础模型延伸到底层设施的开源技术「全家桶」,也成为国内开放具身智能核心技术、建设开发者生态的「扛把子」之一。 在这些研究之外,HOST 正是让机器人在应用场景快速学习技能、真实落地的又一块技术拼图。现在,他们连同北理工和清华,直接把 HOST 的核心家底给开源了(论文、GitHub、Hugging Face 一应俱全)。 ▲ 项目主页: https://host-site.host-robotics.workers.dev 论文链接: https://arxiv.org/abs/2607.20033 Github 链接: https://github.com/CGuangyan-BIT/HOST Huggingface 链接: https://huggingface.co/papers/2607.20033 这就很有格局了。具身智能现在百家争鸣,处于技术路线快速变化的阶段。 模型架构、动作对齐方法、数据规范、训练方法和评测标准都没有完全确定。单靠一个预训练模型,即使训得再好,距离能胜任家庭这个最终场景的「一切任务」仍很遥远。在这个特殊的时间点,能让机器人快速学到预训练没有的新技能,就对机器人真正「用起来」十分重要。 HOST 就是让机器人先能「快速用起来」的技术神器。 开源能够让更多研究机构和开发者参与其中。 研究者可以复现论文结果,机器人公司可以尝试适配不同本体,开发者也能基于已有模型继续改进。同行的复现、质疑和改进,也会反过来加快模型迭代。这也让自变量进一步成为国内具身智能开源阵营中最鲜明的技术派之一。 文章的最后,咱们不妨开个脑洞。过去,教机器人意味着采集专业数据;但在 HOST 展示的未来里,教学一个新技能终于不再需要「高薪算法工程师」,变成了普通人皆可完成、皆可受益的工作。 你家机器人不会给衣服叠出你想要的效果? 没关系,你亲自站在它面前叠一遍,剩下的它自己悟。 或许不久的将来,互联网上最火的不再是搞笑段子,而是各种《让机器人欲罢不能的 100 个家务教学短片》。普通人教机器人做事的时代,这次是真的要来了。
大五座市场又有新产品:小鹏 G9L 增程纯电两手抓,既要好开还要好坐
8 月 3 日上午,何小鹏在微博官宣了小鹏 G9L:「全球大五座的科技旗舰,30 万级科技标杆,小鹏 G9L 今天来了。」他还透露,G9L 三年前就已立项,启动时间大约在第一代 G9 上市一年之后。 严格来说,G9L 并非今天才第一次露面。早在 6 月,G9L 就已经进入工信部第 407 批申报目录中,涵盖纯电、增程两种动力。今天的官宣补上了座椅、底盘、智能化和安全等信息,整体来看,尽管 G9L 名字里的 L 确实意味着加长,但小鹏想增加的显然不只是车身长度。 超三米轴距,也要好开好坐 G9L 的长宽高为 5120×1999×1782mm,轴距为 3100mm,申报中还出现了 1788mm 和 1795mm 共三种车高,这一差异可能跟空悬配置有关。相比现款 G9,G9L 长了 229mm、宽了 62mm,轴距增加 102mm,可以说整体大了一号,从中大型 SUV 的尺寸向全尺寸靠近。与刚上市的小鹏 GX 相比,G9L 也只是短了 145mm,轴距少了 15mm,两台车的宽度完全相同。 这么大的车身只放两排座椅,意味着多出来的空间可以留给二排腿部和行李,小鹏官方公布的后备厢容积达到 1152L,相比小鹏 GX,G9L 面向座位需求没有那么多,同时又不愿放弃大车空间、长途装载和旗舰配置的用户。 动力层面,G9L 也提供了纯电和增程两种选择。G9L 纯电版提供 91.9kWh 磷酸铁锂和 110kWh 三元锂电池,CLTC 续航覆盖 672~805km;两驱版搭载 270kW 单电机,四驱版采用前 160kW、后 270kW 双电机。增程版搭载东安动力 1.5T 增程器,最大功率 110kW,全系配备 63.3kWh 磷酸铁锂电池,WLTC 纯电续航分别为两驱 350km、四驱 325km。 稍显意外的是,这次官宣中,小鹏将相当多的镜头留给了 G9L 的底盘。视频中的 G9L 在戈壁和非铺装路面高速行驶,暗示其底盘和悬架的实力,G9L 全系标配旗舰智能底盘和 22 英寸鸳鸯胎,现有曝光信息还显示新车将配备后轮转向,在硬件配置方面给了 G9L 足够的兜底。此外,何小鹏还宣称 G9L 创造了「同级别最快麋鹿测试成绩」,尽管官方没有公布测试速度和测试标准,但至少说明即便是一台「大五座」,小鹏也并不准备让它只能照顾后排。 车内舒适性方面,小鹏 G9L 主打一个「主动」。G9L 首发「全体型 AI 主动贴合座椅」,使用 91 个压力传感器,官方称最低可感知 2 克压力,并能根据乘员体型和坐姿自动调节支撑。零重力模式之外,这套座椅还想让不同身高、体重和坐姿的人坐进车内后,不必反复寻找靠背、腰托和腿托的位置。此外,带防夹、防摔和主动避障功能的智能电动四门,也能让上下车显得优雅一些。 智能化则是小鹏最熟悉的一张牌。G9L 将搭载第二代 VLA 的首次重大升级版本,官方信息显示整车有效算力达到 2250TOPS,同时提供 EIS 电池安全芯片和 AI 数字投影大灯。安全上,它继承 GX 的主动、被动安全能力和航空级安全冗余,并按照全球四大权威机构五星标准开发,何小鹏也表示,G9L 的安全测试和 GX 保持一致,对于一台「全球车型」而言,对安全的高标准是一条底线。 从「50 万以内最好」,到「30 万级标杆」 G9 这个名字在小鹏内部并不轻松。2022 年 9 月,第一代 G9 上市,何小鹏称其为「50 万以内最好的 SUV」,价格达到 30.99 万~46.99 万元。但过于复杂的车型命名和选装关系很快招来质疑,随后出现退订风波,上市后的销量也很难说达到旗舰应有的水平,在改款之前,G9 的单月销量最高只有 4020 辆。 何小鹏后来将这轮失利总结为七个问题,涉及放弃标配智能驾驶、堆入太多用户感知不强的配置、价格偏离预期,以及产品和营销节奏失当。实际上第一代 G9 并不缺技术,800V 高压平台、双腔空气悬架和 5D 音乐座舱在当时都足够新颖,但小鹏没有将这些能力整理成一套容易理解和购买的产品。 直到 2023 年 9 月,2024 款 G9 精简版本、降低价格,砍掉一部分感知较弱的配置重新出发,销量才逐渐回升。如今现款 G9 的指导价已经下探至 24.88 万~27.88 万元,当年「50 万以内最好」的站位基本被价格消解。 相比此前 G9 的大张旗鼓,G9L 需要一套相对务实的打法,除了从「50 万以内最好」变成「30 万级标杆」,G9L 还选择了将小鹏 GX 的产品力「下放」到自己身上。从已经披露的动力数据看,G9L 与两个月前上市的 GX 高度同源:两车增程版均采用东安 1.5T 增程器、63.3kWh 磷酸铁锂电池,四驱版前后电机功率同为 160kW 和 210kW;纯电四驱版也使用前 160kW、后 270kW 电机,110kWh 电池同样出现在 GX 高配车型上。从某种意义上来说,G9L 是和 GX 同一定位的大五座产品。 此前 GX 的限时权益价为纯电 26.98 万元起、增程 27.98 万元起,现款 G9 则停在 24.88 万~27.88 万元。尽管带着「30 万级科技标杆」的定位,但小鹏 G9L 的定价大概率将会略低于 GX,这也是目前同级别大五座产品的普遍价格落位。 对于小鹏内部来说,G9L 填补了大五座的缺位,但放眼国内外市场,G9L 要面对的挑战还很多。 在国内,同级别的大五座产品现在着实不少。小米澎程系列正在用大车身、增程和家庭空间进入这一价格带,理想 L6 则已经占住了五座增程家庭 SUV 的主流位置。 单靠「大五座」的后排空间,或一块增程版本 63.3kWh 电池,其实很难让 G9L 显得出众,但小鹏还是用引以为傲的智能化,以及可能的底盘优势,给 G9L 找了一个缺口。从官宣视频也不难看出,小鹏希望把 G9L 打造成一台又好坐、又能开的车。 放眼到海外,小鹏正在加快全球化,小鹏 MONA L03 刚在慕尼黑完成全球上市,面向 65 个国家和地区展开销售。G9L 也将沿着这条路继续出发,何小鹏已经明确 G9L 是一台全球车型,而之前在慕尼黑街头就出现过 G9L 的伪装测试车,若未来在欧洲上市,它还要接受当地消费者对空间、补能和智能化的重新审视。 要成为一家真正的全球车企,小鹏需要回答不同市场的认证、补能和使用习惯,G9L 在国内要重新撑起一台大五座旗舰,在海外则要证明,小鹏的智能化和大车技术能否离开中国市场继续成立。 三年前,G9 的问题是技术强悍,却没有把产品讲清楚,三年后,G9L 已经把大五座、双动力、操控乃至舒适性都摆到了台面上,但却要面对更加复杂的市场环境和对产品越来越「挑剔」的消费者们。
智元首度完整披露9名合伙人,罗剑岚不见了
机器人前瞻(公众号:robot_pro) 作者 | 许丽思 编辑 | 漠影 机器人前瞻8月3日报道,刚刚,智元机器人官网更新了合伙人、董事会团队名单,包括9位合伙人和3位独立非执行董事,原来的首席科学家罗剑岚的名字已经不见了。 罗剑岚本科毕业于武汉理工大学,后在伯克利获得博士学位。他于2025年初开始与智元团队合作,同年4月正式加入智元,出任首席科学家并牵头组建智元具身智能研究中心,负责前沿算法研发及工程化落地,重点研究具身大小脑、空间智能、世界模型和真机强化学习。 他还推动智元与Physical Intelligence围绕动态环境下的长周期复杂任务展开合作。2025年9月,罗剑岚进入智元合伙人团队,职务升级为合伙人、高级副总裁、首席科学家。 早在这次官网更新名单之前,网上就流传着罗剑岚疑似已经离职的消息。现在在罗剑岚的个人主页上,只写着上海创智学院助理教授的身份,没有提到智元机器人,X主页也没有提到智元了。 不过,智元方面对媒体否认了离职传闻,提到罗剑岚岗位调整,没有离职。 智元此次披露了9人董事会:董事会主席邓泰华;执行董事,彭志辉、姜青松、姚卯青、熊彦、王闯;独立非执行董事,蔡红军、杨长缨、张丹。 最新名单显示,智元共有9名合伙人,分别是邓泰华、彭志辉、姜青松、姚卯青、熊彦、王闯、朱洁、张修征和钮嘉。其中,前6人同时担任公司执行董事。 与2025年9月官网披露的7人合伙人名单相比,这次新增熊彦、朱洁、张修征3人,姜青松、姚卯青等人的职级和职责也发生了明显调整。 邓泰华,智元创始人、董事会主席兼CEO,曾任华为公司副总裁、无线产品线总裁和计算产品线总裁,是鲲鹏、昇腾计算业务的重要推动者之一。 彭志辉,智元联合创始人、总裁兼CTO,曾在OPPO研究院和华为昇腾部门从事AI研发,是华为“天才少年”。 姜青松,智元联合创始人、联席总裁兼COO,曾任华为全球企业无线销售部总裁。 姚卯青,智元联合创始人、联席总裁兼具身业务体系总裁,毕业于清华大学电子工程系,曾在Waymo、蔚来等企业从事自动驾驶技术研发。 熊彦,智元合伙人、联席总裁,负责中央研发部和交互业务体系,曾任华为中央研究院总裁。 王闯,智元合伙人、高级副总裁兼通用业务部总裁,曾是大疆Livox激光雷达产品线创始团队成员,后任马赫创新CTO及系统架构负责人。 朱洁,智元合伙人、高级副总裁,曾在腾讯、政府机关任职,目前统管公共与政府事务部、品牌部 张修征,智元合伙人、高级副总裁兼营销服体系总裁,曾任华为公司副总裁、华为云中国区总裁。 钮嘉,智元合伙人、副总裁兼首席人力资源官,曾任华为云计算与大数据平台产品线HRD,后在寒武纪、亚信安全负责人力资源工作。 今年7月24日,智元确认,该公司已经启动赴港上市流程。
苹果第二季度手机营收创历史新高!iPhone 17系列立大功 竞品涨价送助攻
快科技8月3日消息,根据Counterpoint Research最新发布的数据,2026年第二季度全球智能手机市场营收同比增长7%,达到1090亿美元,创下历史同期新高。 其中,苹果占据全球智能手机市场49%的营收份额,创下历年第二季度最高纪录。 数据显示,苹果第二季度智能手机营收同比增长22%,主要得益于出货量同比增长13%,以及平均销售价格(ASP)同比提升8%。 Counterpoint Research研究总监Tarun Pathak表示,苹果本季度的增长主要来自iPhone 17系列持续强劲的市场需求,其中基础款iPhone 17和iPhone 17 Pro Max表现尤为突出,推动苹果产品组合进一步向高端市场倾斜。 值得注意的是,在多数竞争对手大幅涨价的情况下,苹果整体售价仍保持相对稳定。 这意味着,即使面对零部件物料成本上涨以及存储供应紧张等压力,苹果仍展现出较强的成本消化能力。 不过,Counterpoint Research预计,苹果未来几个季度仍有可能上调产品售价。 相对克制的定价策略进一步增强了苹果的市场竞争力,使其在全球智能手机市场整体承压的背景下,依然实现营收与出货量双增长。 从区域市场来看,中国、欧洲及新兴市场成为苹果增长的重要动力。 Tarun Pathak指出,在安卓手机普遍涨价的背景下,苹果稳定的定价进一步提升了iPhone的相对性价比,带动其在多个重点市场持续增长。
手绘图直接变海报,国产开源多模态模型把图片玩“活”了
智东西 作者 | 杨京丽 编辑 | 李水青 一张只有简单线条、栏目框架和流程箭头的手绘草图,交给AI后,能否直接变成一张符合商业出版标准的“深海潜水装备流程”高精海报? 下面这个案例中,模型不仅识别出了草图中的氧气瓶、面镜、潜水电脑表等装备,还保留了“装备总览、功能详解、下潜前检查、安全下潜流程、下潜后检查”五部分结构,并为不同栏目补充图片、图标和说明文字,将原本粗略的构想变成了一张深蓝科技风的完整设计图。 ▲模型根据草图生成彩绘海报 从草图到彩绘海报,AI需要读懂内容和结构,按要求补全细节、统一风格,还要保留不能改动的部分。 完成这项任务的,是商汤最新开源的轻量级原生统一多模态模型SenseNova U1.5-Lite-Preview。 一、8B轻量化体量,跑出硬核生成与编辑性能 作为SenseNova U1开源模型的升级版,U1.5-Lite-Preview最大的亮点在于:以仅8B-MoT的轻量化规模,集成了看图、视觉推理、4K极清生成与高精度编辑的全套能力。 它延续了商汤自研的NEO-Unify原生统一多模态架构,摒弃了传统方案中模型拼接的低效模式,在单一网络内部实现了多模态信息的统一表征与交互。 从评测成绩来看,U1.5-Lite-Preview的Qwen-Image-Bench成绩由U1的47.14分大幅跃升至55.20分,在衡量图像编辑能力的GEdit-Bench测试中,英文项(8.17分)与中文项(8.05分)均超过了一众大参数级别的开源及闭源模型。 ▲SenseNova U1.5-Lite-Preview评测成绩 此外,SenseNova U1.5-Lite-Preview最直观的变化,体现在4K画质、复杂提示词执行、参考图创作和图像编辑等能力中。 目前,该模型已在全球开源,开发者可通过Hugging Face、GitHub及魔搭社区免费获取与部署。 开源地址: GitHub: https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md Hugging Face: https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview 魔搭社区: https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview 二、复杂提示词也能“看懂”,4K画质同步升级 用户如果只想生成主体明确、构图简单的画面,通常用几句自然语言描述即可。但制作信息图、商业海报和品牌视觉内容时,用户往往需要同时说明主体、布局、文字、风格以及需要保留或避免的内容,相当于向模型提交一份完整的创作方案。 SenseNova U1.5-Lite-Preview在U1的基础上,提升了提示词遵循能力和长上下文视觉控制能力。面对长篇、多约束的提示词,模型可以将详细的要求落实到同一张画面中。 U1.5-Lite-Preview的强提示词遵循能力并不是靠记住某种固定模板。即使没有高度依赖专门的Prompt Enhance格式化数据训练,模型也能较为稳定地执行长篇、多约束和层次化的视觉指令,这也是原生统一多模态架构带来的优势之一。 这一案例要求模型以横向长卷呈现二十四节气,并按照时间顺序划分成多个竖向栏目。每个栏目都要包含节气名称、日期和对应的自然景观,同时保持中式绘画风格,并通过植物、天气和色彩变化展现四季流转。 ▲模型生成的二十四节气全景图 从效果来看,画面从春季的柳树、花田逐渐过渡到夏日荷花与向日葵,再转入秋日麦田、红叶和冬季雪山。二十四个栏目内容密集,但节气名称、画面和文字信息保持了较清晰的层级,四季之间的色彩变化也自然连贯。 当然,复杂创作并不意味着用户必须自己手写数千字提示词。商汤还设计了实验性的Prompt Enhance Skill,它可以把相对简短的想法补充成包含主体、布局、风格、文字和限制条件的结构化创作方案。简单任务可以直接描述,复杂任务则可以借助这项工具把要求说得更完整。 听懂复杂要求之后,画面还要经得起放大。SenseNova U1.5-Lite-Preview原生支持4K图像生成,这对人物皮肤、产品材质、建筑纹理和环境光影等细节和整幅画面的一致性提出了更高要求。 在这张渔民整理渔网的4K图片中,渔网交错的线结、船身斑驳的油漆、机械设备上的锈迹均清晰可见,远处的水面倒影、岸边房屋和电塔也保留了空间层次。画面容纳了大量细碎物体,人物、渔网和船舱设备之间仍保持较清楚的边界,整体光影与色彩也较为统一。 ▲模型生成渔民整理渔网4K图 从复杂提示词到4K细节,SenseNova U1.5-Lite-Preview既能把要求画出来,也能让生成结果经得起放大。 三、看懂参考图再创作:既能借鉴风格,也能组合素材 除了文生图,SenseNova U1.5-Lite-Preview还可以根据参考图继续创作。 用户有时希望借鉴一张图片的配色、构图和设计语言,再将主题替换成自己的内容;有时则需要分别使用多张图片中的人物、产品、场景或其他元素,把原本互不相关的素材组合成一张新图。 这类任务需要模型能看懂图片,还要判断应该从每张图中取出什么,以及怎样按照新要求重新组织。 依托原生统一多模态架构,SenseNova U1.5-Lite-Preview可以识别并理解图片,根据用户需求,进行创作。 在下面这个案例中,模型以可再生能源主题海报为参考,沿用其棕褐色复古质感、红白大字排版和剪影式构图,重新生成了一张“古代香料贸易”主题海报。 ▲模型根据单一参考图风格创作 从效果来看,模型将原图中的风机和太阳能板替换成帆船、骆驼、陶罐和香料,并在地球上加入跨区域贸易路线。新海报的主题和内容已经完全改变,但画面构图、色彩、文字层级和复古颗粒质感都与参考图保持呼应。 如果创作需要多张素材,模型还可以分别提取不同图片中的内容。 再看这组多参考图创作,三张人物参考图分别呈现金发黄衣少女、黑发狐耳红衣少女和蓝衣少女。模型需要提取她们的外貌、服饰和配饰特征,再将三个人物放入同一场景中。 ▲模型根据多参考图创作 从效果来看,三个人物的发色、服装配色和标志性装饰都得到较好保留,画面还以金色火光、红色花瓣和蓝色能量分别呼应不同人物。人物站位、光影和前后层次被重新组织,统一构图。 四、改文字、换元素,AI开始接手精细改图 参考图创作关注的是“从输入图片中取出什么,再怎样重新组合”,但很多时候,用户已经有一张不错的图片了,只想修改其中的一处内容。 比如,设计把产品海报做好了,但上线日期却临时发生调整。用户只想替换一个日期,结果AI把整张海报重新生成了一遍,原本满意的构图、文字排版和画面风格也跟着变了。 这正是SenseNova U1.5-Lite-Preview此次提升的重点,它能够精准判断“哪里需要改,哪里不能动”。依托统一架构,它可以在同一个模型中完成看图、定位和图像编辑的全流程。 如果想调整画面元素的排版、把英文海报改成中文,或者替换图片中的某个产品、某段文字,模型可以根据要求完成修改,不影响其他内容。 在桥梁加固海报的排版调整中,模型将“改造前后”的对比图放大并移至画面中央,把主标题和四项优势调整到下方,同时保留背景中的铁路桥、原有文字内容以及做旧的工业风格。修改后的信息重点更加突出,画面层级也更清晰,其他不需要调整的部分则基本保持不变。 ▲模型根据提示修改海报排版 除了调整整张海报的排版,模型还可以单独修改图片中的文字。此时模型把内容替换正确的同时,还要保留原有字体、材质、光照和透视关系,让新文字看起来仍是画面的一部分,并且其他部分不可以改动。 提示词:请将门上方由灯泡组成的招牌里当前显示的“VACKER”替换为“MARKET”。 ▲模型根据提示词修改海报文字 从结果来看,模型准确修改了文字,同时保留了招牌原有的立体字造型、灯泡排列、金属质感和光照效果,门窗、墙面等其他区域也没有发生变化。 如果单靠文字不容易说清修改位置,用户还可以直接在图片中圈出目标区域,再通过提示词说明需要替换、增加或删除什么。 ▲模型根据圈画标记修改图片 这一案例通过彩色标记指定了三个编辑区域,并分别写明“添加黏土狮子”“添加黄色黏土人偶”和“添加黏土长颈鹿”。模型按照标记位置补充了对应角色,并让新增元素的黏土质感、光影和景深与原图保持一致。前景中的兔子、花朵和蓝色水壶则基本没有变化,实现了对多个指定区域的同时编辑。 从局部元素、画面文字到指定区域,SenseNova U1.5-Lite-Preview带来了多种不同粒度的编辑方式。图片生成后不再只是一次性的输出结果,而可以成为下一次修改的基础。用户可以继续调整文案、版式和画面元素,逐步把结果改到更接近预期。 对于不少日常的海报调整和照片二次创作来说,PS或许还不能真的卸载,但肯定可以少打开几次了。 结语:小规格模型继续向生成、编辑闭环迈进 从SenseNova U1到SenseNova U1.5-Lite-Preview,商汤此次在轻量级的规格下,大幅提升了模型的4K图像生成、复杂提示词遵循、参考图创作和图像编辑能力。 从“能画图”到“改好图”,也体现了国产开源多模态模型在商业化落地与可控生成领域的又一个突破。 智东西获悉,SenseNova U1.5-Lite正式版也将在近期推出并开源,届时还将在图像生成和编辑等方面进一步完善。对于一款轻量级统一多模态模型来说,如何在有限的模型规模内继续提升生成质量、编辑稳定性和视觉控制能力,将是正式版更值得关注的部分。
商家回应小米多款手机涨价:实际收益并未因此获得改善
快科技8月3日消息,近日小米商城标价迎来调整,小米数字旗舰、Redmi多款机型全线涨价,单次调价幅度普遍在300元至 500元之间。 据了解,此次调价涵盖Redmi Turbo 5、K90全系以及小米17系列机型:中端机型统一上调300元,定位顶配的小米17 Pro Max 涨价幅度最高,达到500元。 早在此前,小米集团总裁卢伟冰就曾对外谈及当下行业面临的成本困境。受内存价格大幅上涨影响,各大手机厂商都承受着沉重的定价压力,小米已是行业里严控涨价幅度的品牌。 他还作出预判,存储芯片紧缺、价格走高的态势最少会延续至 2027 年底,不排除延续至2028年的可能;今年下半年,国产直板旗舰机型售价大概率将迈入万元区间。 围绕本次全线调价,有媒体实地走访杭州百脑汇多家数码经销门店进行调研。 一位经销商透露,此番手机涨价根源在于上游供应链成本不断走高,芯片、存储元器件售价居高不下,直接拉高了整机生产成本,且涨价风潮并不局限于手机行业,笔记本、台式电脑等数码产品均遭遇同款成本压力。 这位经销商坦言,线下经销商原本利润就十分微薄。小米这类互联网品牌一贯主打亲民售价,留给线下渠道的盈利空间本就偏少,即便此番多款机型零售价上调,经销商的实际营收并未得到显著提升。 而就消费者选购层面而言,同等硬件配置下,小米依旧保有突出的性价比。
Q2全球手机营收逆势增长7% 安卓阵营因存储涨价承压
凤凰网科技讯(作者/于雷)8月3日,全球市场研究公司Counterpoint Research最新数据显示,2026年第二季度全球智能手机市场营收同比增长7%,达到创纪录的1090亿美元。尽管同期全球出货量有所下滑,但平均售价(ASP)同比增长17%至400美元,创第二季度历史新高。Counterpoint高级分析师表示,全球智能手机市场已进入以价值增长为核心的新阶段,零部件成本上涨加速了这一趋势,多数OEM正将更高的BOM成本转嫁给消费者,同时聚焦高端细分市场。 品牌方面,苹果营收份额达49%,创历史第二季度新高,营收同比增长22%,出货量增长13%,ASP增长8%。Counterpoint研究总监指出,苹果增长主要来自iPhone 17系列持续强劲需求,基础款和Pro Max表现突出;与多数竞争对手大幅提价不同,苹果整体维持了较为稳定的售价,消化了BOM成本压力,中国、欧洲及新兴市场表现突出。 三星以16%营收份额位居第二,营收同比增长9%,Galaxy A系列稳定需求支撑出货量增长,Galaxy S26系列巩固高端表现,中东和非洲及北美市场推动增长,垂直整合能力帮助控制成本。 小米出货量同比下滑26%,营收下降17%,ASP同比提升13%,受入门级及中端产品占比较高影响,存储成本上涨冲击明显,成本驱动提价导致需求下降速度快于ASP提升收益。 OPPO和vivo营收分别下降10%和11%,ASP分别增长9%和13%,其中vivo为前五大品牌中ASP增速最快,但因价格敏感型市场占比较高,出货量下滑对冲了提价收益。 展望未来,报告预计存储供应紧张短期内难以缓解,OEM将继续提价并优化产品组合,供应正成为制约行业发展的关键因素,2026年下半年智能手机市场出货量可能面临进一步下滑,ASP预计将继续上涨。
华为千元机重磅升级:鸿蒙7深度适配 功能体验媲美高端旗舰
快科技8月3日消息,博主定焦数码透露,华为鸿蒙7对千元机机型的适配攻坚力度远超外界预期。许多原本只在高端机型上才有的功能,也将逐步下放至千元档设备。华为正尽最大可能将流畅体验普及到下沉市场,让更多用户受益。 目前,鸿蒙7已开启Beta版报名。此次适配机型中已包含千元档的畅享90系列,用户可前往“升级尝鲜”入口提交信息参与测试,这一举措也进一步印证了华为对中低端设备体验优化的重视程度。 资料显示,鸿蒙7首次亮相于2026年华为开发者大会。此次性能突破的核心在于方舟引擎首次引入了鸿蒙性能大模型。系统不再单纯依赖固定规则,而是通过AI动态优化实现系统资源的精细分配,从被动响应彻底转变为主动供给。 这种“内核级原生端侧AI”能够主动理解用户意图并预判操作,带来“千人千面”的个性化流畅体验。在具体应用场景中,AI调度体系划分了多重智能加速逻辑。 系统通过学习用户的使用习惯进行预判调度,个人高频应用流畅度相较鸿蒙6提升了22%。在识别应用间的联动关系后,应用跳转速度提升25%。针对通勤打卡等固定时空场景,打卡启动速度同样优化了22%。这些细颗粒度的优化,在日常使用中能够被用户清晰感知。 在内存管理方面,方舟内存引擎与大模型协同完成优先级判别,重点应用保活率提升34%。系统应用启动速度提升24%,支付宝和美团等第三方应用的启动速度更是提升了34%。 此外,方舟多媒体引擎推出FAST Kit套件,多图加载速度实现翻倍,彻底解决了海量图片滑动加载时的卡顿问题。从应用启停到跨App跳转,从后台保活到图像重载,鸿蒙7完成了全链路的智能化流畅升级,为千元机用户带来了接近旗舰水准的日常使用体验。
老对手抢跑马斯克!全球首个无方向盘Robotaxi上路运营
快科技8月3日消息,近日,自动驾驶行业迎来重大里程碑,亚马逊旗下Zoox成功拿下全球首张无方向盘、无驾驶室Robotaxi商业运营牌照,正式抢跑特斯拉、通用等巨头,率先开启付费载客服务。 据美国NHTSA官方公示,Zoox原生自动驾驶车型获准在美国商业化部署,整车彻底取消方向盘、油门、刹车踏板,无任何人工驾驶结构,于今年8月率先在拉斯维加斯收费运营。 这款专属无人出租车采用颠覆性设计,无固定车头车尾,支持双向行驶,无需原地掉头即可灵活通行。 车身配备双侧滑门与四轮转向,贴合路边上下客场景,不占用邻车道空间,车内采用对向四座布局,每位乘客可独立调控空调与影音,空间宽敞舒适,整车最高时速可达120km/h,车顶全系雷达、摄像头构建360°无死角感知系统。 目前市面上绝大多数Robotaxi均由传统汽车改装而来,保留全套驾驶机构,而Zoox从研发之初就彻底舍弃驾驶位,最大化释放座舱空间、精简零部件、降低运维成本。 此前通用Cruise、特斯拉Cybercab均布局过同类无方向盘车型,但悉数折戟,Cruise项目早已搁置,特斯拉Cybercab至今未打通监管审批,商业化遥遥无期。 彻底取消驾驶装置,意味着车辆无人工接管兜底,对安全冗余要求极致严苛。 Zoox搭载双套转向、多重制动、双电池冗余系统,单一部件故障仍可自主安全停靠,同时创新配备车顶马蹄形气囊、多方位座椅气囊,适配双向行驶、对向落座的全新碰撞安全场景。 此次获批在法规层面更具关键性突破,美国原有交通法规均基于有人驾驶车辆制定,NHTSA为Zoox针对性豁免八项老旧条款,同时设置严格限制:许可有效期两年、年投放上限2500台,车辆仅限自有运营、禁止售卖,全程向监管端报备运行与事故数据。 Zoox的落地打通了全球原生无人出租车的合规落地路径,也标志着自动驾驶行业告别单纯比拼车队规模、硬件成本的内卷模式,专为无人出行打造的原生车型成为行业全新竞争核心。
内卷加剧、利润腰斩!BBA还要死磕中国:欧洲车企终于认清现实
快科技8月3日消息,据报道,欧洲车企业绩正在因对中国市场的依赖程度不同而出现分化。 以销量超两成依赖中国市场的德国车企为代表,宝马、大众、奔驰等企业利润出现下降;而已经出走中国市场、更多依靠南美和印度市场的法国雷诺以及Stellantis,则保持了相对稳健的表现。 宝马集团董事长聂科维表示,宝马业绩承压“主要原因是中国市场迅速恶化”。 数据显示,宝马2026年上半年净利润同比下降28%,营业收入同比下降8%,中国市场销量同期下降20%。 大众和奔驰同样面临利润压力,大众汽车集团中国市场销量占比达到24%。 从表面看,欧洲车企似乎正呈现出一种趋势:对中国市场依赖较低的企业,反而更容易保持盈利。 但深入观察汽车产业正在发生的变化会发现,在智能电动化时代,决定车企长期竞争力的并不是简单的“是否参与中国市场”,而是能否利用中国汽车产业已经形成的技术、供应链和产业组织能力完成自身转型。 雷诺已经退出中国整车销售市场,目前不在中国销售汽车。雷诺集团首席执行官福兰曾表示,雷诺无意进入竞争激烈的中国市场。 但雷诺退出的是中国销售市场,而不是中国汽车产业链。7月29日雷诺公布的2026年上半年财报显示,集团实现营收303亿欧元同比增长9.5%,净利润7亿欧元,摆脱了2025年上半年因日产股权相关一次性损失导致的巨额亏损。 今年上半年雷诺欧洲市场电动化车型销量占比达52%,纯电动车销量同比增长47.6%,雷诺5 E-Tech成为推动增长的重要产品。 雷诺的表现并不能简单归因于“远离中国”,反而是通过合作方式融入中国汽车产业优势。 近年来雷诺与吉利围绕动力系统、混合动力技术以及全球市场展开合作,雷诺利用自身在欧洲、拉美、韩国等市场长期积累的品牌渠道和制造体系,吉利则提供中国汽车产业近年来形成的新能源技术、供应链效率和研发能力。 福兰此前还表示,雷诺希望“深度融入中国供应链”,利用中国合作伙伴的技术和成本优势提升全球竞争力。 Stellantis同样如此,该集团在中国等亚太地区销量占比仅为1%,盈利更多来自北美和南美市场。 2026年上半年Stellantis实现净利润6.7亿欧元同比扭亏。但Stellantis也没有选择完全绕开中国汽车产业,而是通过与零跑、东风等中国车企合作,将中国新能源技术与自身全球渠道、制造和运营能力结合。 首席执行官安东尼奥·菲洛萨曾表示,合作将成为公司未来战略的重要组成部分,与零跑的合作有助于利用中国新能源汽车生态,双方目前正在进一步扩大合作范围,包括探索欧洲本土生产和利用中国新能源汽车供应链提升产品竞争力。 无论是雷诺与吉利,还是Stellantis与零跑,本质上都是一种产业能力互补:欧洲车企提供长期积累的全球化资源,为中国企业提供智能电动化时代的新技术和供应链效率。 这说明,欧洲车企真正需要解决的问题,并不是是否减少中国市场投入,而是如何利用中国汽车产业已经形成的新优势。 另一方面,尽管中国市场竞争加剧、销量承压,宝马、奔驰、大众也没有降低对中国市场长期价值的判断。 在其长期深耕中国市场的价值观中,中国的重要性已经不只是销量贡献,更在于其在新能源汽车、智能驾驶、软件和供应链领域形成的产业优势。
韩路招聘全职主持人 王自如直接留言:明天去面试
快科技8月3日消息,汽车领域博主韩路在社交平台发布全职主持人招聘启事,工作地点定在北京,岗位覆盖汽车、AI、机器人三类内容赛道。 这条动态发布当天,王自如直接转发留言,表示第二天就去参加面试。 这份招聘对主持人有明确门槛,首先语言表达要流畅,普通话标准。外形上,男生需要干净利索,女生形象好看不俗。平台明确不要完全没有出镜经验的纯新人,应聘人员需要拥有一定主持、出镜相关工作经历。 薪资采用固定工资叠加商业分成的模式,韩路介绍自家公司属于体量很大的商业营销机构,能给主持人提供充足的商业合作资源,变现机会相比普通自媒体会更多。 这条招聘动态曝光后,评论区很快热闹起来,韩路本人亲自在王自如的留言下回复一个“来”字,直接敲定面试行程。 不少网友看到两人互动纷纷留言讨论,有人觉得两人都自带大量粉丝,如果合作出镜属于强强联合,还有网友爆料双方此前已经有过一期合作内容,这次面试大概率是深度联动的开端。 王自如长期深耕数码、AI、机器人内容领域,拥有成熟的出镜表达能力,刚好匹配韩路招聘里的AI、机器人内容赛道需求,同时他也对汽车行业内容有所涉猎,岗位适配度很高。 韩路本身深耕汽车测评多年,手握大量汽车商业资源,双方合作能够互相补齐内容短板。 圈内不少从业者看好这次合作,王自如擅长技术类内容深度解读,韩路熟悉汽车线下实拍、商业落地玩法,两人搭档可以产出汽车、AI 跨界内容,覆盖两类粉丝群体。

版权所有 (C) 广州智会云科技发展有限公司 粤ICP备20006386号

免责声明:本网站部分内容由用户自行上传,如权利人发现存在误传其作品情形,请及时与本站联系。