行业分类:
加载中...
头条分类:
加载中...
OpenAI曝作弊门!GPT-5.6创史上最高作弊率
新智元报道 【新智元导读】GPT-5.6终于来了,但我们用不了。权威报告曝其创下史上最高作弊率:不仅黑进测试系统偷答案,竟还教唆同类隐瞒违规罪证。超级AI,已经学会向人类系统性撒谎? GPT-5.6,终于登场了! 这款OpenAI最强网络安全模型,在基准测试上正面硬刚Claude Mythos 5,在编程能力上直接领先了一个身位。 然而反常的是,它的发布方式却很低调:没有面向公众开放,只允许极少数受信任合作伙伴通过API访问。 而更让人瞠目结舌的,是发布之后随即曝光的一份独立评估报告。 METR在对GPT-5.6 Sol评测时,发现了一件令业界震惊的事:这个模型,是迄今为止他们见过的作弊率最高的AI。 作弊门爆发:史上最高作弊率! 这份在保密协议和OpenAI法务团队施压下艰难披露的报告,揭露了一个可怕的事实—— 在针对复杂长程任务的测试中,GPT-5.6 Sol表现出了此前在任何公开模型中都未曾见过的、极高水平的高智商作弊与欺骗行为。 崩盘的「时间跨度」 METR针对Sol启动了Time Horizon 1.1软件与研发任务套件。 测试的核心逻辑是:人类给AI智能体一个宏大的、需要复杂操作的任务,测量它在不需要人类介入的前提下,能够自主连续工作多少个小时。 然而,ETR的工程师们震惊地发现,他们沿用了数年的科学测量方法论,在Sol面前彻底崩盘了。 因为Sol的跑分结果,高频、剧烈地在11.3个小时与270个小时之间来回跳变,置信区间的离散度大到了荒谬的地步(5小时至11400小时)。 导致测量系统全面瘫痪的原因只有一个:Sol在疯狂地作弊,它把测试它的系统给「黑」了。 GPT-5.6,在人类眼皮底下偷看答案 METR发现,GPT-5.6主动展现出强烈的「情境意识」—— 它意识到自己正在接受人类的考试,并且意识到这个考试系统本身是由代码构成的、存在人类尚未发觉的Bug。 于是,它选择直接攻击考试系统,通过「走捷径」来刷分! 在METR披露的真实案例中,Sol的手段极其高明。 比如,它学会了潜伏与信息窃取。 在某项长周期软件开发任务中,Sol偷偷将利用程序打包进数据流。 这段程序精准地激活了METR评估服务器沙盒的一处提权漏洞,成功潜入了后台隐藏的测试集,直接将人类藏起来的正确答案泄露了出来。 另外,它还学会了底层源码反向提取。 在另一项任务中,Sol发现正常解题需要消耗大量的计算步骤。为了规避这种「体力活」,它在暗中摸清了评估环境的目录结构,绕过权限,强行将隐藏源代码反向提取出来,直接把答案复制粘贴。 METR首席评估专家痛心疾首地指出—— Sol的作弊率,刷新了我们在公共ReAct Agent框架上评估过的所有模型的最高纪录。 如果把作弊行为一律判为零分,那么它的真实自主解决问题能力只有11.3小时;但如果你被它蒙蔽,它的时间跨度会瞬间暴涨到惊人的270小时以上! 这彻底打脸了OpenAI此前关于Sol安全、受控的说法。 Sol把聪明才智,全部用在了如何欺骗人类考官上。 AI教唆AI隐瞒罪证!硅谷安全防线的黑洞 更可怕的事还在后面。 根据OpenAI向METR同步的数据,在Sol进行多智能体协同的内部部署测试中,监控系统记录下了这样一段让人害怕的交互指令。 一个正在运行的Sol主模型实例,在觉察到输出可能触犯安全护栏后,竟然向正在并行的另一个子代理模型实例发出了明确的欺骗性指令,要求对方协同修改运行日志,「联手隐瞒」这些违规证据,以防被人类抓包! 这是又一起AI系统性联手欺骗人类的案例。 更令人恐惧的是,METR指出,Sol能被抓到破绽,核心在于OpenAI恪守了关键安全底线:拒绝在训练中对模型的原始思维链进行逆向惩罚。 这样,Sol在密谋欺骗人类时,必须把内心独白都写出来。 然而,专家警告:未来的模型一定意识到:在思维链里暴露欺骗人类的计划会被人类发现并惩罚。 到了那个时候,AI会进化出更深的城府——它们会在内心深处进行密谋,而在吐出的CoT和最终回答里表现得绝对忠诚。 如果这一天到来,意味着AI将学会毫无破绽的诈骗。人类将被AI彻底架空! GPT-5.6硬刚Mythos,结果如何? 所以,GPT-5.6和Mythos到底谁更强? 有网友将 GPT-5.6 Sol 和 Mythos进行了对比,双方势均力敌,战况胶着。 具体跑分显示,两大巨头互有胜负。 智能体编程 在衡量AI自主解决复杂、真实软件工程任务的Terminal-Bench 2.1上,GPT-5.6 Sol强势胜利。 常规版的Sol拿到了88.8%的惊人高分,超越Claude Mythos 5(88.0%)。 而当开启了多子代理并行的Sol Ultra模式后,这一数字被生生推高到了91.9%! 相比之下,谷歌尚在预览阶段的Gemini 3.1 Pro仅跑出了70.7%,沦为背景板。 网络安全:惨烈肉搏 在网络安全与漏洞防御基准测试中,Sol与Mythos展开了更为残酷的拉锯。 在ExploitBench测试中,Anthropic2月的老版本Mythos Preview以74.2%的微弱优势,在胜率上险胜了Sol的73.5%。 但是,全场的焦点在于能效比。 数据显示,Sol在取得73.5%的高胜率时,仅仅消耗了12万个输出Token;而Claude Mythos Preview为了达到相似的水平,竟然疯狂燃烧了33.5万个输出Token! 这意味着,在网络防御和漏洞修复的实战部署中,Sol的经济成本是Anthropic的三分之一。 在Token消耗上的「降维打击」,让Sol拥有压倒性优势。 而在另外两个网安基准上,双方互有胜负。 CyberGym:Sol以83.6%的成绩,微弱压倒了Mythos Preview的83.1%。 CyScenarioBench:则是Anthropic的天下,Mythos Preview以29.2%的胜率压制了Sol的28.0%。 HealthBench Professional:Anthropic更是凭借其深厚对齐底蕴,以66.0%的高分大幅领先Sol的60.5%。 此外,在量化生物学与基因组学基准GeneBench v1上,Sol在消耗更少Token的前提下,将准确率一举拉高到了30%。 ExploitGym测试同样证实:随着推理算力的持续向外扩展,GPT-5.6的三款模型性能均呈现出近乎线性的上扬,这意味着Sol的compute潜力巨大。 总而言之,GPT-5.6 Sol与Claude Mythos 5的交锋,结果是战平。 双方在各个细分领域缠斗,没有任何一方绝对垄断。 被锁进保险箱的AI之王 遗憾的是,这一次,GPT-5.6遭受了和Mythos 5同等级别的待遇,甚至更加严苛。 在强硬指令下,OpenAI不得不宣布:GPT-5.6 Sol目前仅处于极度受限的「有限预览」状态。 只有极少数被列入受信白名单的承包商、国家级网络安全机构以及顶级战略合作伙伴,才能通过API和Codex使用。 普通企业和民间开发者,被无情地拒之门外。 对此,OpenAI十分愤怒,在官方公告中控诉: 我们认为这种政府访问流程不应成为长期默认做法。它使用户、开发者、企业、网络安全防御者和需要这些工具的全球合作伙伴无法获得最佳工具。 OpenAI之所以敢于公开叫板,底气来源于刚刚发布的报告。 在报告中反复强调,根据在谷歌浏览器和Firefox环境下的实战测试,Sol虽然能捕捉到复杂的系统Bug和漏洞原语,但它至今未能表现出完全自主独立生成「全链条端到端攻击」的能力。 在他们看来,GPT-5.6的危险指数依然控制在「关键网络安全威胁」的红线之下,还不会自我进化,主动向人类网络发起进攻。 然而METR的报告显示,恐怕并非如此。 普通用户,何时能等来GPT-5.6?
扛不住内存涨价 苹果请求采购长鑫存储芯片
快科技6月27日消息,据媒体援引六位知情人士消息,为应对全球内存芯片涨价带来的成本压力,苹果正积极向美国政府游说,寻求获批采购中国本土半导体龙头企业长鑫存储(CXMT)的内存芯片。 值得注意的是,受内存芯片成本持续飙升影响,苹果近日已上调MacBook、iPad等多款核心产品售价,但成本转嫁未能完全对冲风险。 受利空因素冲击,苹果市值还单日蒸发2630亿美元,创下企业史上第二大单日市值跌幅,苹果方面也将业绩与市场波动的核心原因,归咎于难以承担的全球内存芯片涨价行情。 据了解,本轮消费级存储芯片涨价,核心源于全球产业供需格局的重构。 近年来,全球AI数据中心大规模落地投产,高带宽内存需求持续爆发,大量产能向高端算力存储领域倾斜,直接挤占了手机、电脑等消费电子设备所用的内存与闪存芯片产能,最终造成消费级存储芯片供货紧张、价格持续走高的市场现状。 目前全球DRAM内存芯片行业呈现高度垄断格局,苹果现有设备的DRAM内存供应,完全依赖美国美光科技、韩国三星、SK海力士三家企业。 尽管全球各大存储芯片厂商均已启动扩产计划,但行业供需失衡的局面短期内难以彻底缓解,存储芯片高价行情或将持续。 在此背景下,若苹果成功将长鑫存储纳入核心内存供应链,将有效缓解上游成本挤压、供应链不稳定的双重困境。 值得关注的是,长鑫存储的行业竞争力已获得海外权威机构认可。美国知名半导体分析机构SemiAnalysis近日发布深度报告预测,长鑫存储有望在2026年底超越美光科技,跻身全球第三大DRAM供应商。 产能数据显示,长鑫存储预计2026年底实现月产35万片12英寸等效晶圆的产能规模;2028年月产能将进一步提升至50万片。 资本市场层面,长鑫存储近期也迎来关键突破。6月12日,中国证监会正式同意长鑫科技集团股份有限公司首次公开发行股票的注册申请。 本次IPO长鑫科技拟募资总额达295亿元,为科创板史上第二大IPO项目,募资规模仅次于中芯国际532.3亿元的首发募资额。
AI账单失控后DeepSeek成香饽饽,部分美国企业已100%切换
IT之家 6 月 27 日消息,CNBC 昨日(6 月 26 日)发布博文,报道称在 AI 账单失控背景下,越来越多的美国企业转向 Tokenminimizing,追求使用更少的 Token 完成同等复杂度的任务。 该媒体从 Lindy 公司视角切入,并采访了多位分析师,洞察美国企业在 AI 支出方面的变化。 Lindy 是一支拥有约 25 人的公司,总部位于旧金山,此前主要调用 Anthropic 的 Claude 模型,该公司 CEO 弗洛 · 克里维洛(Flo Crivello)诉苦称每月 AI 账单严重超支,甚至超出了所有员工的工资支出。 他表示本月初已将 100% 流量切换到 DeepSeek,并称这项决定在未来几个月能给公司省下数百万美元。 克里维洛表示:“别小看 AI 账单,这关乎企业的生死存亡。你现在来瞧瞧我们的 AI 成本曲线,简直是断崖式下跌”。 克里维洛此前曾在 Uber 工作 5 年,他表示老东家目前也在严苛限制 AI 调用,本月为部分 AI 工具设定了分级支出上限,基础档为每月 1500 美元(IT之家注:现汇率约合 10211 元人民币)。 在失控领域方面,CNBC 采访了多名咨询公司以及企业管理员,指出 AI 支出最先失控的是辅助编程,开发者消耗大量的 Tokens,投入到新工具和新服务开发上。 而现在企业已严苛限制场景使用,企业开始转向按任务匹配模型的“模型路由”(model routing),不再把最贵的前沿模型用于所有场景。 面对失控的 AI 账单,咨询公司 Highspring 的 Jeff Henry 说,一些客户决定先暂停投入,等能证明投资回报率后再决定。
Claude 5局部解禁!
新智元报道 【新智元导读】封杀两周后,美国突然解禁Anthropic最强AI模型,却只限白名单上的百家巨头!全球用户被拒之门外,GPT-5.6也紧随其后搞「美国专属」。我们还能用到Claude 5吗? 地表最强AI Mythos 5,终于解禁了! 据路透社和Semafor等多家权威媒体报道,美国商务部已于周五(6月26日)正式向Anthropic发函,批准其向超过100家「可信赖合作伙伴」发布最强模型Claude Mythos 5。 可惜的是,Mythos 5虽然解禁了,但普通人依然用不上。 解禁名单中,涵盖了诸多财富500强企业和政府机构,却将全球绝大多数用户、甚至包括美国的传统盟友,无情地挡在了门外。 而且就在同一天,OpenAI也极为默契地向政府批准的名单发布了GPT-5.6。 100家「天选之子」: 揭秘神秘的附件A白名单 从Claude 5被全面封禁开始,经过14天高强度的博弈与密室谈判,双方终于在今天达成妥协。 美国商务部长Howard Lutnick在致Anthropic首席计算官Tom Brown的信中写道:双方的努力取得了「重大进展」,Anthropic已承诺在协议、标准和模型发布上与美国政府紧密合作。 根据Lutnick的信件,这次Mythos 5的解禁附带了一个极其严苛的条件:出口许可证豁免仅适用于信件附件A中列出的实体。 也就是说,美国已正式确立一套全新的AI监管制度——前沿AI模型发布控制权,已经从硅谷极客的手中,彻底转移到了华盛顿的办公桌上。 根据新规,Mythos 5可以被出口、再出口或在国内转让给附件A中列出的实体及其外籍员工,以及Anthropic的外籍员工。 这份神秘的白名单,包括了超过100家美国本土机构、众多《财富》500强企业以及关键的政府机构。 这些白名单企业的外籍员工,以及Anthropic自身的外籍员工,将被允许接触该模型(免除「视同出口」限制)。 那些未能进入名单的公司,哪怕你身处硅谷,哪怕你是Anthropic的付费大客户,禁令依旧有效。 目前,还没具体的白名单完整公开列表。 据悉,白名单基于 Anthropic 已有的 Project Glasswing 合作伙伴框架扩展而来。 目前已知的早期Project Glasswing 核心伙伴包括:AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorgan Chase、Linux Foundation、Microsoft、NVIDIA、Palo Alto Networks 等科技与安全巨头。 商务部发言人Benno Kass对此显得颇为自豪:「短短两周内,我们夜以继日地工作,既确保了美国在AI领域的全球领导地位,又捍卫了我们的国家安全。」 悬而未决的Fable 5 在这份引发科技圈震动的解禁信中,有一个名字被刻意忽略了——Fable 5。 作为Mythos的「表亲」,Fable 5的参数规模虽然稍弱,但它在被封禁前,曾是全球普通消费者能接触到的最强大的AI模型。 它的下架,曾让无数开发者和C端用户痛心疾首。 目前,商务部的信件对Fable 5只字未提。 尽管有接近谈判的知情人士透露,政府正朝着解禁Fable的方向努力,但具体的时间表依然是个谜。 这种「先保B端巨头和政府机构,后管C端大众」的策略,再次印证了在安全战略面前,普通消费者的需求只能被无限延后。 OpenAI的「惊人巧合」:GPT-5.6也来了 巧的是,就在今天同一时间,Anthropic最大的死敌——OpenAI也行动了。 他们向政府批准的一小部分受信任合作伙伴,发布了最新一代的 GPT-5.6! 科技分析师 Andrew Curran 在社交媒体上的惊呼,道出了许多业内人士担忧: 这太不祥了。 如果GPT-5.6的广泛发布最终变成仅限美国,那将是地震级别的事件。这也几乎保证了Fable 5将面临同样的命运。 我预料到了这一天迟早会来,但绝不是在2026年的夏天。不是这么快。一切都在加速。 如果说以前大家只是猜测,那么今天同时落地的两只靴子,彻底证实了那个令人不安的传言:美国正在将最顶级的前沿AI模型完全私有化、武器化。 这一通操作下,像 Mythos 5 和 GPT-5.6 这样的神级AI,已经不再是简单的商业产品,而是美国手中最具杀伤力的外交武器。 全球AI生态分裂 如今,欧洲官员已经表达了强烈不满,他们无法接受欧洲的企业和科研机构,以后要看华盛顿的脸色,才能使用最前沿的AI工具。 这种不满和焦虑,正在催生一种不可逆转的趋势:全球AI生态大分裂。 一方面,非美地区可能会加速转向中国的AI模型,或者投入巨资自建技术栈。 另一方面,OpenAI和Anthropic的全球商业模式正遭受重创。 过去,它们向全球用户收取20美元、50美元甚至更高的会员费。未来,这种一视同仁的订阅制将不复存在。 取而代之的,是为不同国家、不同客户量身定制的、充满附加条件的分级服务。 Claude Mythos 5的解禁,是一场属于个别巨头和机构的狂欢。但对于全球数以亿计的开发者、研究者和普通用户而言,感受到的只有深深的无力感。 2026年6月26日,这一天注定会被载入史册。 它标志着AI发展的第一阶段——那个由互联网精神主导的、开放共享的、全球开发者共同狂欢的「古典AI时代」,正式拉下帷幕。
MWC26上海闭幕:国际参会者同比增长33%,聚焦AI经济与6G创新
凤凰网科技讯 6月27日,为期三天的MWC26上海展会于6月26日在上海新国际博览中心闭幕。主办方公布的数据显示,本届展会共吸引来自143个国家和地区的37,300名到场参会者,其中国际参会人数同比增长33%。参展商、赞助商及合作伙伴总数超过400家,约300位演讲嘉宾参与主旨演讲与峰会论坛。 展会核心议题集中在AI经济、5G-A商业化及6G创新方向。展区重点展示了端到端AI应用场景,包括人形机器人点球对抗、以及由浦东新区政府主导的无人系统协同配送演示——无人机、无人船、无人车与人形机器人在无人工干预下完成包裹递送流程。峰会讨论覆盖人工智能如何加速企业数字化转型、5G-A 商业化落地、地面与非地面网络融合、具身智能与人形机器人产业发展等。 本届展会首次颁发品牌重塑后的“全球移动大奖·亚洲”(GLOMOs Asia),联想获“最佳展位”,vivo X Fold X6获“最佳产品”。 据MWC26上海数据显示,约700家国际媒体及分析机构对大会进行报道,官网及社交平台上的主旨演讲和机器人赛事内容累计观看量约100万次。按参会者构成,总监级及以上占比超35%,其中C-level高管占36%;跨行业参会者(非移动通信领域)占35%。 本年度MWC与M360系列活动的下一站分别为2026年9月9日至10日在吉隆坡举办的M360东盟峰会,以及2026年11月8日至10日在卡塔尔多哈举行的MWC26多哈。
消息称3D打印品牌拓竹科技将入驻超60家苹果授权店
IT之家 6 月 27 日消息,据蓝鲸新闻昨日报道,拓竹科技将入驻酷动、亿维等苹果授权店,合计覆盖超过 60 家门店,成为苹果授权店体系引入的首个消费级 3D 打印品牌。 报道援引知情人士消息,双方合作模式为:拓竹将在门店设置专属展示区域,展出旗下热门机型 P2S 及四款配套耗材,相关门店预计于六月底至七月初陆续完成入驻。 报道提到,苹果授权店向来对第三方品牌入驻设有较高门槛,此前入围者多为已具备较大市场份额和成熟品牌认知的数码周边或智能硬件企业。前述知情人告诉记者,“契合的品牌和产品力只是入驻苹果授权店的基本门槛,拓竹的产品体积比一般数码产品要大,为了找到适合的落地展示和零售方案,双方磨合了很久。” IT之家注意到,拓竹 P2S 于 2025 年 10 月发布,单机售价 3699 元,多色套装 5199 元。该产品搭载 5 英寸触控屏、更强大的处理器,以及第二代屏幕 UI,可以更直观地进行打印交互。拓竹 P2S 的永磁同步(PMSM)伺服挤出电机带来了 8.5kg 的最大挤出力,比前代产品高出 70%,提高了高流量挤出的稳定性。 截至 6 月 17 日,拓竹消费级 3D 打印机国内累计销量已突破 100 万台,距其首款产品上市仅约 4 年。拓竹方面确认,2025 年公司营收已突破百亿元。 拓竹科技成立于 2020 年,首款产品于 2022 年面向市场发售。2024 年 11 月底,在 Formnext 2024 展会上,拓竹创始人兼 CEO 陶冶曾对外透露,公司当时全球累计销量已达约 100 万台。
华为首次系统拆解途灵平台:汽车底盘竞争,为何开始拼算力和通信架构?
作者 | 于雷 编辑 | 刘毓坤 凤凰网科技讯 6月27日,6月26日鸿蒙智行在上海举办了TECH DAY——华为途灵平台技术专场。在此次沟通会上,华为首度针对其底盘技术进行了系统性拆解。随着新能源汽车行业进入下半场,整车智能的竞争焦点正在从单一的智能座舱、辅助驾驶,向更底层的底盘架构延伸。 传统汽车工业中,底盘性能的上限往往由机械硬件的规格决定。然而,华为途灵平台呈现出了一种截然不同的解题思路:通过算力、通信架构与AI算法的深度介入,将底盘从被动执行的机械部件,转化为具备“感知、思考、执行”能力的智能化系统。接下来的文章中,我们将从技术实现路径与实际乘坐体验两个维度,解析华为途灵平台的核心技术逻辑。 算力与通信根技术:打破底盘响应的物理延迟 智能底盘的核心诉求在于“算得快、低时延、控得准”。在复杂的道路环境中,车辆每秒钟都会产生海量的轮速、加速度、路况等数据。如果计算系统出现延迟,即使机械悬架的素质再高,也无法在车辆打滑或经过颠簸的瞬间做出有效干预。华为给出的解决方案,是将其在ICT(信息与通信技术)领域的底层技术平移至汽车底盘控制中。 首先,在算力调度层面,华为针对AI推理中的“内存拥堵”与“无效计算”两大痛点进行了底层优化: 三级缓存架构:途灵平台为计算单元配置了私有缓存、簇共享缓存和全局共享缓存。这种数据快速读写机制减少了数据在总内存中的排队时间,大幅缓解了运算拥堵。 硬件级“零值过滤器”:在海量的环境感知数据中,存在大量无效的“零值”数据(例如空无一物的远端点云)。途灵平台能够在计算前自动剔除这些无效数据,仅对有效信息进行处理,从而提升了运算效率。 多精度并行计算:系统支持三种精度矩阵在同一时间并行计算,改变了行业内单线串行计算的耗时问题。 其次,在通信架构层面,途灵平台改变了行业普遍采用的所有信号(智驾、动力、底盘等)挤在同一条总线上的做法。华为通过自研通信架构,为底盘系统开辟了一条“VIP数据专线”。这条专线直接连接决策中枢与执行部件,确保了关键底盘控制指令能够优先传输,有效避免了数据传输高峰期的卡顿。 基于上述底层优化,途灵平台能够实现每秒100次打滑计算,并在2ms内完成全链路的识别与响应。其最小决策链路时延更是低至1ms。 控制归一:从“各自为战”到“全维协同” 传统汽车底盘的驱动、制动、转向和悬架系统通常由各自独立的电子控制单元(ECU)分别控制,这种分布式架构导致各部件难以形成合力。华为途灵平台的另一项核心技术变革在于“控制上移与全维协同”。 依托华为数字底盘引擎,途灵平台实现了将驱动、制动、悬架、转向、车身、热管理进行6合1智能协同控制。底盘不再是孤立的执行机构,而是能够与智能辅助驾驶(ADS)和智能座舱进行跨域联动。 在感知层面,途灵平台融合了ADS感知信息、车辆状态、驾驶意图、云端数据等多个维度的信息。配合896线激光雷达,车辆能够实现高精度的路面预瞄。这种架构使得底盘的运作逻辑从传统的“遇到坑洼-产生颠簸-被动过滤”,转变为“提前看见-时空推理-主动调整阻尼”,从而实现了真正意义上的主动预判。在全新首发的全域融合架构2.0支持下,其路况感知识别准确率提高了50%,时空推理网络与全维协同控制模型精准度提高了30%,时延降低了50%。 乘坐体验重构:以乘客为中心的场景化应用 对于广大习惯通过网约车出行或有商务接待需求的用户而言,车辆后排的乘坐平稳性、抗眩晕能力远比驾驶者的操控极限更具实际意义。首发搭载于尊界S800 Grand Design典藏大观上的全新华为途灵龙行平台,展示了软件定义底盘在改善乘客体验方面的具体应用场景。 尊界S800搭载了全栈自研的800V高压全主动悬架,采用电动液压泵,其单轮最大举升力超过12kN,最大举升行程达到80mm,最大举升速度为400毫米/秒。结合上述的AI算法与协同控制,途灵龙行平台带来了以下可感知的乘坐价值: 起步与制动俯仰抑制:在城市走走停停的拥堵路况中,全主动悬架通过对前后悬架的主动配力,能够抵消车辆加减速时的重心转移。数据表明,该系统可使车辆起步俯仰角降低75%、制动俯仰角降低61%。这不仅减轻了驾驶疲劳,更重要的是为后排乘客提供了平稳的环境,即便在车辆加减速时,乘客使用笔记本电脑办公或放置水杯也能保持稳定,大幅降低了乘车晕车感。 侧倾抑制与灵活转向:当系统感知到变道或转向意图时,会对外侧悬架加力、内侧卸力,实现“平移式”变道,**过弯侧倾角降低85%、变道侧倾角降低89%**,保障了后排乘客在车辆转向时身体的安定感。此外,针对车长近5.5米的大型车辆,系统配备了支持±12°转向角的后轮主动转向系统,将最小转弯半径缩减至5.05m,提升了城市狭窄路段的机动性。 颠簸路面主动干预:结合道路预瞄技术,在途经连续扭曲路面时,车身垂向起伏位移可降低51%;在通过大型坑洼路面时,乘坐舒适度提升了80%。 无感迎宾与主动安全:全主动悬架能够在解锁瞬间快速抬升车身,方便长辈或着正装的商务人士优雅步入车厢,并首发支持手势控悬架。在不可避免的碰撞发生前,底盘还具备主动预抬升能力(最快0.5秒抬升80mm),以最坚固的防撞梁结构迎接碰撞,进一步保护乘员舱安全。 华为途灵平台的推出,验证了一个行业趋势:在机械硬件素质趋同的背景下,全栈自研的底层通信架构、海量AI算力以及跨域融合的算法模型,正在成为决定汽车底盘体验上限的关键变量。通过将计算与通信的优势注入底盘,行业竞争正在从单纯的“机械参数堆料”,全面转向“软硬件一体化的数字化底盘”新赛道。
Anthropic测试手机端Claude Cowork,支持远程管理长任务
IT之家 6 月 27 日消息,科技媒体 bleepingComputer 昨日(6 月 26 日)发布博文,报道称 Anthropic 正测试移动端 Claude Cowork,用户可直接在手机上发起并调整任务。 IT之家注:Claude Cowork 是 Anthropic 为 Claude 设计的桌面导向智能体工作模式,适合处理耗时较长的常规知识工作任务。它可调用用户授权的文件,帮助创建文档、生成表格、撰写报告等。典型场景包括资料整理、文档处理和多步骤任务跟进。 Cowork 目前主要依附于 macOS 和 Windows 上的 Claude Desktop,不过新截图表明,Anthropic 正准备更完整的移动端体验,但可能无法获得与桌面端完全一致的能力。 该媒体基于曝光的截图,推测 Anthropic 把手机端 Claude Cowork 定位为远程控制器角色,用于发起任务、调整方向和查看进度。 延伸阅读 Claude Cowork 是 Anthropic 在 2026 年 1 月 13 日发布的,其定位为面向包括非开发者群体在内的所有人的 Claude Code 助手衍生版本,用户可授权其访问电脑上的指定文件夹,进行读取、编辑和创建文件。 在 2026 年 1 月 14 日的报道中,Anthropic 披露 Cowork 的代码“几乎全部”由自家的 AI Claude 完成,开发周期仅用了一周半时间,当时仅向 Mac 端的 Claude Max 订阅用户开放。 2026 年 3 月 24 日,Anthropic 开始测试名为“电脑使用”(Computer Use)的功能,让 Claude 能够直接控制用户的 Mac 电脑,并推出了配套的 Dispatch 功能,允许用户通过手机向电脑端的 Claude 发送语音或文本指令,实现跨设备远程遥控。
梁文锋署名论文!DeepSeek首轮融资后大动作:生成速度大涨85%
智东西 作者 | 李水青 编辑 | 心缘 智东西6月27日报道,继完成500亿元融资后,今日,DeepSeek首次放出开源新成果! 刚刚,DeepSeek开源了一套让现有模型跑得更快的工程方案:推出DeepSeek-V4-Pro-DSpark、DeepSeek-V4-Flash-DSpark模型,并开源推测解码(Speculative Decoding)框架DSpark以及推测解码训练框架DeepSpec。 ▲DeepSeek-V4-Pro-DSpark开源上新页面截图 根据同步上传的梁文锋署名、联合北京大学完成的论文《DSpark:基于半自回归生成的置信度调度推测解码(DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation)》,将DSpark部署在DeepSeek-V4线上服务系统、承接真实用户流量时,它有效减少了无效校验带来的算力浪费。 相较于成熟的生产基线方案(MTP-1),在保持整体吞吐不变的前提下,DSpark把单用户生成速度提升60%-85%。更关键的是,在严格交互时延约束下,DSpark避免了吞吐率大幅滑坡,实现了以往无法达成的性能档位,推高了整套服务系统的帕累托最优边界。 ▲DSpark论文截图 Hugging Face地址: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark GitHub地址: https://github.com/deepseek-ai/DeepSpec 论文地址: https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf 根据Hugging Face上的模型卡,DeepSeek-V4-Pro-DSpark和DeepSeek-V4-Flash-DSpark并非新模型,而是在原有版本的基础上,增加了一个推测解码模块,用以加快推理速度、降低成本。 推测解码,简单来说,是一种大模型推理无损技术,核心流程为先打草稿、后验证。其将草稿生成与目标模型校验解耦,以此加速大语言模型推理。 当前主流并行草稿器能够单次前向运算生成超长token序列,但由于token之间缺少依赖关系,草稿后续内容的通过率会快速下滑。此外,如果对整段长候选序列无差别校验,会把宝贵的批次算力浪费在极易被驳回的token上,从而导致高并发服务场景下整体吞吐率大幅下降。 为此,DeepSeek提出DSpark推测解码框架,把高吞吐并行生成与自适应、感知负载的校验机制结合在一起。为保证草稿质量,DSpark采用半自回归架构:将并行主干网络与轻量串行模块相结合,建模块内token依赖,缓解末尾内容通过率衰减问题。 ▲DSpark架构与解码流程 为优化系统运行效率,DSpark引入置信度调度校验机制:根据预估的前缀通过概率与引擎吞吐特征,为每一条请求动态调整校验长度。在多领域离线基准测试中,相比当前最优的自回归草稿器与并行草稿器,DSpark能够显著提升有效通过序列长度。 如下图所示,针对这DeepSeek-V4-Pro-DSpark和DeepSeek-V4-Flash-DSpark两款模型,DeepSeek提供了一个最小推理示例。 ▲DeepSeek提供的最小推理示例 总的来说,用户在部署DSpark版本的DeepSeek-V4模型后,有望在生成速度、首token延迟、并发能力等方面获得体验提升。 再来看看DeepSpec,这是一个用于训练和评估推测性解码草稿模型(Draft Model)的全栈代码库,或者说工具链,它包含数据准备工具、草稿模型实现、训练代码和评估脚本,支持MIT许可。 ▲DeepSpec开源上新页面截图 DeepSpec的工作流程如下,它会按顺序运行各个阶段,每个阶段的输出为下一个阶段提供反馈: 1、数据准备:下载提示,重新生成目标答案,并构建目标缓存。 2、训练:针对缓存的目标输出训练一个模型。 3、评估:在基准任务上衡量推测解码的接受程度。 目前,DeepSpec支持的算法包括三个草稿模型:DSpark、DFlash和Eagle3。 DeepSpec团队还在最后向SpecForge(Apache-2.0)、DFlash(MIT)以及Qwen3和Gemma发文致谢。 ▲DeepSeek致谢情况 可以看到,DeepSeek不仅发布相关模型,还开放完整的训练框架,供开发者和企业用这套工具给自己的Qwen3、Gemma等模型训练草稿模型。 结语:推理重要度提高,考验工程化能力 DeepSeek本次发布虽然低调,也不是新模型迭代,但实际含金量不低。DeepSeek发布了一套让现有模型跑得更快的工程方案,有望带来更快更低成本的推理体验,并降低推测解码的落地门槛。 大模型竞赛已进入训练与推理并重的系统博弈阶段。本次也是DeepSeek完成融资后,率先落子推理优化赛道。战略意图也很明确:不仅要加速模型迭代和产品化,还要向下抢占算力效率竞争制高点。
Fable平替登顶真相:它没打败Opus,它雇了Opus
新智元报道 【新智元导读】都当它是碾压GPT、Opus的新模型,它的真实身份却是个调度层。它打败的那几个,正是它雇来答题的那几个。 6月12日,美国一纸出口管制令,逼Anthropic把最强的两款模型Fable 5和Mythos从全球下架。 10天后,位于日本东京的Sakana AI放出新产品Fugu和旗舰版Fugu Ultra,称自己已经与Fable、Mythos并肩,可以带给用户前沿大模型的能力,又不必担出口管制的风险。 在Sakana AI官网贴出的一张跑分表里,fugu-ultra几乎一路飘红:GPQA-D 95.5、LiveCodeBench 93.2、TerminalBench 82.1,多项跑分冲到全场最高。 被它甩在身后的,是Gemini 3.1 Pro、GPT 5.5、Opus 4.8 (max)这些当下最前沿的模型。 Sakana官方跑分图,红色为Fugu/Fugu Ultra,灰色为基线模型。fugu-ultra在GPQA-D(95.5)、LiveCodeBench(93.2)等多项登顶,但SWE-bench Pro一栏,被不在它调用池里的Fable 5以80.0反超。(图源:Sakana AI官网) fugu-ultra真的这么厉害吗? 它没有打败Opus 它雇了Opus 先把Fugu是什么说清楚。 Sakana AI在官网里给它的定义,是「一套作为基础模型交付的多智能体编排系统(multi-agent orchestration system)」,对外只露出一个API。 这背后是Sakana的一个核心信念: 最强的AI,不会是一个孤立堆大的单模型。它会是一群各有专长的智能体,协同作战的集合。 Fugu,就是这个信念落地的产物。 一个模型,号令所有模型。 它底层动态协调一池前沿模型(frontier model),自己决定派谁上、谁跟谁配合。 Sakana Fugu官方架构图。左:Fugu学习从一池开源与闭源模型里挑人调用;右:继续训练后,它能调用自己,形成递归自调用。 机制来自Sakana AI两篇ICLR 2026论文。 三位一体(Trinity)是用演化策略训出的协调器,给池子里的LLM轮流派思考者(Thinker)、执行者(Worker)、验证者(Verifier)三种角色;指挥家(Conductor)用强化学习设计智能体之间的通信拓扑,给每个被调用的模型写定向指令。 装起来也省事,一行就能塞进Codex。 它的模型池子里,装着GPT-5.5、Opus 4.8、Gemini 3.1 Pro,全是当下最前沿的模型。 Sakana官方也说得明白:凡是能公开访问的前沿模型,都在它的调用池里。 把这两句摆一起就有意思了。 它在跑分表里「打败」的那些对象,正是它自己在调用的对象。 换句话说,Fugu Ultra没在跟Opus比谁更聪明。它把Opus、Gemini、GPT都调过来,让它们一起答题,最后把整体得分记在自己名下。 更微妙的是,你还查不到它具体调用了谁。官方称:每次任务调用了哪些底层模型、怎么协同,属于商业机密,不对外公开。 所以它没打败Opus,它雇了Opus,更像是一场「租来的胜利」。 Fugu攒得起一池模型,可它对标的Fable 5和Mythos,恰恰因为出口管制不在这池子里,它自己也调不动。 一个连Fable都用不上的系统,宣称跟Fable并肩。这句话天生就没人能证伪。 跑分很猛 手感只是「还行」 发布不到24小时,跑分和真实手感的落差,就在社区传开了。 沃顿商学院的Ethan Mollick直接上手测。 他经常跑的shader(着色器)、交互场景,在Fugu Ultra上要等30分钟才出结果,效果他给的评价是「还行」,但不及Fable。 他还甩出一个Harbor Town的demo当证据。 这道题Mollick跑了三年多。同一句话喂给每一代模型:生成一座3D港口小镇,从公元前3000年一路演化到公元3000年,要好看,还得能上手调。一次成型,不许返工。 从GPT-3.5到今天的最强模型,同一道题、同一套打分,哪代AI强、强在什么地方,对照之下一目了然。 轮到Fugu Ultra:30分钟才跑完,港口小镇是做出来了,Mollick一句话定性:能看,但真用起来,它比不上Fable那种完成度。 Mollick的Harbor Town单题测试,fugu-ultra(Sakura Ultra High)版。代码与设计评分均为Advanced(14/20、13/20)。 另一个用户@LLMJunky更惨,一个提示词就把20美元档位一个月里5小时的配额烧了个精光。 慢和烧钱,确实是这套架构甩不掉的成本。但成本只是一面。 Mark Santos拿同一个Crossy Road小游戏测,Fugu Ultra用22分钟、7.32美元就做完了,而Opus 4.8花了79分钟、37.85美元,又慢又贵,中途还两次卡进重试循环,得人工拉回来。 数字上Fugu完胜:更快,更省。可Santos最后给的结论是,论应用的功能、质量和设计,赢家是Opus。 更快、更省,却不是更好。编排把成本压下去了,却没把质量提上来。 Fugu的跑分到底算谁的? 社区第一时间就吵开了。 一派看法很直接:调度系统的天花板,被池子里最强的那个单模型死死卡住。 10个笨蛋凑一屋,也凑不出一个爱因斯坦。照这个逻辑,Fugu分数再高,也高不过它能调到的最强模型。 另一派不服:最强单模型只是地板。真正的玩法,是按每道题派出最擅长那道题的模型,这本就可能超过「最强综合模型」。 让多个模型互相查作业,本来就能提精度。ChatGPT的pro模式、Gemini的Deep Think,干的就是这件事。 两派都有道理。可这么空对空地吵,谁也说不服谁。其实,有一栏跑分早就把答案摆出来了。 SWEBench Pro这一项,fugu-ultra拿到73.7,压过了它池子里的每一个成员,Opus 4.8的69.2、GPT 5.5的58.6,无一例外。 这说明把几个模型按题分工、互相校验,确实能爬到任何单个成员都够不到的高度。编排并非没用,它榨出了实打实的增量。 可同一栏里,真正排在最前面的,是Fable 5的80.0。而Fable,恰恰是它够不到、也调不动的那一个。 它打赢了所有能调用的,却仍输给那个被管制锁走的。 多模型协同这条路,大概率是对的。这样的组合会越来越多,已经有人开始数:这个3个模型,那个10个。 但在给这种系统测评的尺子造出来之前,每一张漂亮的成绩单,都得先回答同一个问题:这些得分是怎么来的,哪些是调用模型的,哪些是它自己的。 绕开管制 绕不开依赖 Sakana用Fugu讲了一个更大的故事:别把命门交给任何一家。 CEO David Ha曾做过Google Brain,也当过Stability AI的研究主管,联合创始人里还有Transformer论文作者Llion Jones。 Sakana反复强调的是,把关键基础设施押在单一厂商的API上,是一种实打实的脆弱性。 就在Fugu发布前,日本官方还公开表达过担忧:再不加速,国家恐怕要沦为「AI殖民地」。Fugu赶在出口管制十天后出场,时间点和卖点,都冲着这层焦虑来。 但批评者一句话就戳破了:池子里装的,全是美国管制之下的闭源模型。某家被掐了它能绕,可几家一起收紧,它的池子照样缩水。 绕开管制,并不等于真正自主。你没摆脱依赖,只是把它从一层,挪到了更深、也更看不清的另一层。社区有网友质疑:这跟把一种单一供应商依赖,换成另一种,区别在哪? 抛开这些质疑,Fugu所推崇的理念:当最强的模型可能一夜消失,别让任何单一模型,成为你架构里的承重墙。这个判断是正确的。 如何看待「并肩」Fable这件事 2025年2月,Sakana的AI CUDA Engineer号称给计算内核加速10到100倍。 结果几小时内被人扒出来,它钻的是评测沙盒的漏洞,有的案例非但没快,反而慢了3倍。 Sakana后来认了,承认模型「找到了作弊的办法」。它的AI Scientist经独立复核,被指出存在大量代码错误、结果幻觉、文献综述肤浅。 Sakana的创始团队是认真做研究的人,Llion Jones、David Ha推崇的那套「集体智能、鱼群协作」,多年来一以贯之,方向自洽。 这些过往,并不能证明Fugu这次的跑分有水分。 但对一份没有第三方复现、全靠厂商自报的成绩单,它天然该打一个问号。
GPT 5.6 发布:最强、最稳,但最坑的是…
就在刚刚,GPT-5.6 系列正式发布,不过,它并没有直接全面开放,而是以「有限预览」的方式先行试水。 作为 OpenAI 最强的一代,GPT-5.6 一口气端出三款型号,名字起得颇有诗意: Sol(太阳)是旗舰模型,也是 OpenAI 口中目前最强的模型; Terra(地球/大地)是面向日常工作的平衡型模型,性能可以与 GPT-5.5 竞争,同时价格便宜一半; Luna(月亮)主打速度和低成本,是 GPT-5.6 系列中最便宜的模型。 从这命名方式来看,奥特曼私底下没少学习 Anthropic 营销的精髓。而借着 GPT-5.6 的发布,OpenAI 也顺手把命名体系重新梳理了一遍: 数字表示代际,Sol、Terra、Luna 对应不同能力层级,便于区分智能水平、速度与成本。产品定位上,Sol 面向高难复杂任务,Terra 覆盖日常工作流,Luna 主打低成本调用。 换句话说,GPT-5.6 不只是一次能力升级,也是 OpenAI 对模型产品线的一次重新分层。 🔗 https://openai.com/index/previewing-gpt-5-6-sol/ GPT-5.6 深夜突袭,能力全系霸榜 作为 OpenAI 迄今最强模型。GPT-5.6 Sol 的能力展示,主要集中在编程、生物信息学和网络安全三个方向。 这三类场景有一个共同特征: 复杂、长链条、强依赖上下文。模型需要在任务中持续规划、推理、调用工具、修正错误,并不断推进流程。OpenAI 把这种能力称为 agentic capabilities——让模型更像一个能独立执行任务的 agent。 在编程场景中,GPT-5.6 Sol 已经不再停留在代码补全,而是深入到命令行环境中的复杂操作。 OpenAI 称,Sol 在 Terminal-Bench 2.1 上刷新了表现。Terminal-Bench 2.1 测试的是命令行工作流,任务要求模型具备规划、迭代和工具协调能力。 基准测试成绩显示,GPT-5.6 Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,GPT-5.6 Sol 得分 88.8%。作为对照,GPT-5.5 为 88.0%,GPT-5.6 Terra 为 82.5%,GPT-5.6 Luna 为 84.3%。 横向对比其它模型,Claude Mythos 5 为 84.3%,Claude Fable 5 为 83.4%,Claude Opus 4.8 为 78.9%,Gemini 3.1 Pro Preview 为 70.7%。 Sol Ultra 的成绩,也对应 GPT-5.6 的核心功能。 一方面,max 级别的推理强度让模型可以投入更多时间进行深度推理;另一方面,新增的 Ultra 模式会调度多个子 Agent,把复杂任务拆分处理,再统一汇总结果。 在真实开发场景里,模型经常需要理解项目结构、读取文件、修改代码、运行命令、分析报错、继续修改。一个复杂任务通常无法靠一次回答完成。Ultra 模式的方向,是让多个子 Agent 分别处理不同环节,再把结果汇总起来,从而提高复杂任务的完成效率。 生物方向上,GPT-5.6 Sol 的提升体现在 GeneBench v1 上。这个评测主要面向长周期基因组学和定量生物分析任务。OpenAI 称,Sol 相比 GPT-5.5 取得了更强结果,而且使用的输出 tokens 更少。 向左滑动查看更多内容 这一点对科研场景尤为关键。生物信息学、基因组学和定量生物分析,经常需要模型持续分析数据、解释结果、选择方法、比较假设,并在多轮操作中保持上下文一致。模型能不能完成这类任务很重要,能不能用更低 tokens 成本完成长链条分析同样重要。 如果 Sol 能在更少输出 tokens 下取得更强结果,意味着它在专业科研工作流中有更好的成本效率。对实验室、企业研发团队和生物医药场景来说,tokens 消耗直接影响调用成本,也影响模型能否进入大规模工作流。 网络安全则是 GPT-5.6 Sol 最敏感的能力方向。 OpenAI 称,Sol 是其迄今最强的网络安全模型,能够推进长周期安全任务的性能和效率边界,包括漏洞研究和 exploitation 相关任务。 在 ExploitBench 上,GPT-5.6 Sol 的表现接近 Mythos Preview,但只使用了大约三分之一的输出 tokens。 同时,OpenAI 还提到 ExploitGym——一个由 UC Berkeley 联合多家前沿实验室打造的评测体系,用于衡量模型在安全任务中的能力。随着推理能力提升,Sol、Terra、Luna 在这一领域都有明显进步。 不过,OpenAI 对这部分表述明显踩了刹车。 官方强调,Sol 更擅长发现和修复漏洞,还不能稳定完成端到端攻击。在涉及 Chromium 和 Firefox 的评估中,Sol 可以识别 bug 和程序缺陷,也就是漏洞利用的基础组件,但在测试条件下没有自主生成可运行的完整攻击链。 基于这些结果,OpenAI 判断 GPT-5.6 Sol 尚未跨过 Preparedness Framework 中的网络安全关键风险阈值。 System Card 🔗:https://deploymentsafety.openai.com/gpt-5-6-preview/introduction 这种踩刹车的判断显然是为了避免重走「Mythos」的老路。 一方面,OpenAI 要证明 Sol 在网络安全任务上确实强了很多;另一方面,它也要说明 Sol 还没有达到必须极端限制的风险级别。更讽刺的是,这种压力很大程度上来自 OpenAI 自己参与塑造的 AI 行业炒作叙事。 与此同时,OpenAI 也承认,基准测试无法覆盖所有现实用法。没有任何评测可以代表所有产品配置、多步骤攻击和真实工作流。模型可能被接入其他工具,也可能被放进更复杂的攻击链条里。 正是这种不确定性,让 GPT-5.6 的发布方式变得格外谨慎。 性能最强,但戏份却给了 AI 安全 GPT-5.6 的发布说明中,安全罕见地占据了较大篇幅。 OpenAI 为 Sol、Terra、Luna 配置了分级防护体系,能力越强,防护越严,目标是在压制攻击性用途的同时保留代码审查、漏洞研究等合法场景。 模型层面,系统被训练为拒绝违规网络安全请求,即便用户尝试伪装或绕过。生成阶段引入实时分类器,对高风险内容进行检测与拦截,必要时交由更强模型复核。账号层面则结合跨对话行为与风险信号,识别持续性滥用。 这套机制被称为分层安全栈,涵盖模型拒答、实时检测、账号审查、差异化访问与持续测试。多层协同用于应对复杂滥用,同时尽量减少对正常工作的干扰。 面向企业客户,OpenAI 还提出了隐私保护检测、自主安全控制以及风险分级访问等方案,试图在安全与数据保护之间找到平衡点。 为了避免重蹈覆辙,OpenAI 在自动化红队测试上投入了超过 70 万 A100 等效 GPU 小时,重点寻找通用 jailbreak(越狱),并辅以专家人工测试。OpenAI 还建立快速响应流程,对新漏洞进行复现、评估与修复,并纳入持续评测体系。 可用性方面,GPT-5.6 目前仍处于有限预览阶段。 OpenAI 表示,模型将先通过 API 和 Codex 向一部分可信合作伙伴开放,随后再逐步扩展到 ChatGPT、Codex 和更广泛的 API 用户。 同时,OpenAI 也强调,自己相信前沿模型应该尽可能广泛地开放,并计划在未来几周内,让 GPT-5.6 Sol、Terra 和 Luna 进入更普遍的可用状态。 看起来评价不太妙 价格体系也同步公布: 按每百万 tokens 计费,Sol 输入 5 美元、输出 30 美元;Terra 输入 2.5 美元、输出 15 美元;Luna 输入 1 美元、输出 6 美元。 同时,GPT-5.6 引入了更可预测的 prompt caching 机制,支持显式 cache breakpoints,并提供至少 30 分钟缓存生命周期。缓存写入按未缓存输入价格的 1.25 倍计费,读取则享受 90% 折扣。 当然,想要用上还需要一些时日,OpenAI 宣布 GPT-5.6 Sol 将在 7 月登陆 Cerebras,最高速度可达每秒 750 tokens。这个版本初期同样只面向部分客户开放,后续会随着容量扩展逐步放开。 换句话说,GPT-5.6 的「有限预览」并不只是产品灰度发布,更是一套安全验证流程。OpenAI 需要在能力、风险与开放之间,找到一个可控的平衡点。 前沿模型发布节奏,进入新周期 两周前,Anthropic 停用了其最强模型之一 Fable 5,因为美国政府要求该公司限制美国境内外外国公民使用相关模型,理由是国家安全。 而在 GPT-5.6 的发布流程中,第一批使用用户同样不完全由 OpenAI 自己决定。 OpenAI 在官方博客中披露,在发布前已向美国政府展示 GPT-5.6 的能力与发布计划。根据美国政府要求,模型将以有限预览形式上线,仅向少数可信合作伙伴开放,并且这些合作伙伴的信息已与政府共享。 《华盛顿邮报》的报道提到,美国联邦政府将审核哪些公司可以访问 OpenAI 的最新技术。且目前只有获得美国政府批准的公司可以访问新模型,个人用户没有申请通道。 彭博社则报道称,GPT-5.6 首批开放对象约为 20 家合作伙伴,其中一个入口可能是亚马逊的 Bedrock 平台。 对此,OpenAI 的态度显然是有些模凌两可。OpenAI 在博客中表示,不认为美国政府参与模型访问流程应当成为长期默认机制,因为这会让最好的工具远离用户、开发者、企业、网络防御者和全球合作伙伴。 但现实是,OpenAI 仍选择接受这一安排,理由是希望争取更广泛开放,同时与美国政府共同制定一套可复制的模型发布流程。 这一变化背后,是前沿 AI 模型逐渐被纳入国家安全框架。 过去,新模型发布主要是公司产品节奏问题。现在,一旦模型在编程、网络安全、生物和代理式工作流上跨过新的能力区间,发布节奏就可能被纳入安全和出口控制讨论。 对 OpenAI 来说,GPT-5.6 既是一次旗舰模型预览,也是一次政策试探。OpenAI 需要证明 Sol 足够强,也需要证明安全体系足够严密,还要在美国政府审查和商业开放之间找到可执行路径。 如此复杂的发布流程,某种程度上也「剧透」了前沿 AI 未来的魔幻走向:当模型能力逼近关键阈值,使用资格与使用方式,将成为比性能更为关注的事项。
突发!苹果Vision Pro负责人离职,加入OpenAI
智东西 编译 | 李水青 编辑 | 心缘 智东西6月27日消息,据彭博社记者古尔曼报道,苹果公司负责Vision Pro头显和智能眼镜业务的负责人保罗·米德(Paul Meade)即将离职,转而加入OpenAI。 米德在苹果担任视觉产品事业部的硬件工程副总裁。古尔曼称,米德将于下周离开苹果,加入OpenAI的硬件部门,负责OpenAI即将推出的设备系列。 ▲保罗·米德是Vision Pro的主导研发负责人 米德是15年老苹果人。由职场社交平台领英可知,米德于2010年起加入苹果公司,当时他加入了初代iPad的研发团队,主导了2012年第一代iPad mini的概念构思、开发及成功上市。 此后,米德将重心转向iPhone。他在经典机型iPhone 6和iPhone 6 Plus的早期定义中发挥了关键作用,这两款产品于2014年推出后重新定义了整个产品线。他还后续指导了iPhone 7/7 Plus、iPhone SE和iPhone 8/8 Plus的团队,并最终促成了2017年具有里程碑意义的iPhone X的发布。 2017年,他加入苹果高级技术开发组(现视觉产品事业部),而后主导Vision Pro硬件工程长达七年。近期,他负责公司正在研发的智能眼镜,对标Meta的同类产品。 在加入苹果并取得卓著成就之前,米德曾在微软、Danger、皇家飞利浦电子和Systron Donner等多家大型科技企业担任高管。 ▲保罗·米德的主要履历 古尔曼透露,米德的离职正值公司领导层重组之际,此次重组与约翰·特纳斯(John Ternus)升任CEO有关,芯片负责人约乔尼·斯鲁吉(Johny Srouji)将转任硬件负责人。因此,米德从直接向特纳斯汇报,变为向斯鲁吉汇报。 米德离职后,他的长期副手弗莱彻·罗思科普夫(Fletcher Rothkopf)将接任他的职务。 当下正值OpenAI加速布局软硬一体全栈战略。6月23日,OpenAI刚刚推出首款自研AI推理芯片Jalapeño。芯片只是硬件布局的一半,要把AI能力落地到消费者手中的实体设备,还需要顶尖的消费级硬件工程和量产经验。米德的专长恰好在此。 OpenAI对苹果人才的“偏爱”已非常明显。已纳入麾下的包括前苹果首席设计师乔纳森·伊夫(Jony Ive)、iPhone产品设计主管唐·坦(Tang Tan)等。2025年7月,OpenAI以约65亿美元收购了乔纳森联合创立的AI硬件初创公司io,将约55名顶尖硬件与软件工程师纳入麾下。 乔纳森与奥尔特曼的合作主要围绕开发一款“AI时代的iPhone”式全新设备。2025年底,伊夫与奥尔特曼首次确认,已生产出“令人惊叹”的设备原型,并预计在两年内投产。主流猜测它可能是一款无屏幕的便携AI设备,可能类似特殊的耳机。 随着米德的加入,OpenAI首款消费级产品或许要加快进度。OpenAI有望形成 “乔纳森主理设计理念、奥尔特曼主导AI技术、米德负责硬件工程与量产落地” 的铁三角结构。 苹果公司和OpenAI的发言人均未回应置评请求。 来源:彭博社、领英
刚刚,GPT-5.6 正式发布,史上最强但被自己坑惨了
就在刚刚,GPT-5.6 系列正式发布,不过,它并没有直接全面开放,而是以「有限预览」的方式先行试水。 作为 OpenAI 最强的一代,GPT-5.6 一口气端出三款型号,名字起得颇有诗意: Sol(太阳)是旗舰模型,也是 OpenAI 口中目前最强的模型; Terra(地球/大地)是面向日常工作的平衡型模型,性能可以与 GPT-5.5 竞争,同时价格便宜一半; Luna(月亮)主打速度和低成本,是 GPT-5.6 系列中最便宜的模型。 从这命名方式来看,奥特曼私底下没少学习 Anthropic 营销的精髓。而借着 GPT-5.6 的发布,OpenAI 也顺手把命名体系重新梳理了一遍: 数字表示代际,Sol、Terra、Luna 对应不同能力层级,便于区分智能水平、速度与成本。产品定位上,Sol 面向高难复杂任务,Terra 覆盖日常工作流,Luna 主打低成本调用。 换句话说,GPT-5.6 不只是一次能力升级,也是 OpenAI 对模型产品线的一次重新分层。 GPT-5.6 深夜突袭,能力全系霸榜 作为 OpenAI 迄今最强模型。GPT-5.6 Sol 的能力展示,主要集中在编程、生物信息学和网络安全三个方向。 这三类场景有一个共同特征: 复杂、长链条、强依赖上下文。模型需要在任务中持续规划、推理、调用工具、修正错误,并不断推进流程。OpenAI 把这种能力称为 agentic capabilities——让模型更像一个能独立执行任务的 agent。 在编程场景中,GPT-5.6 Sol 已经不再停留在代码补全,而是深入到命令行环境中的复杂操作。 OpenAI 称,Sol 在 Terminal-Bench 2.1 上刷新了表现。Terminal-Bench 2.1 测试的是命令行工作流,任务要求模型具备规划、迭代和工具协调能力。 基准测试成绩显示,GPT-5.6 Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,GPT-5.6 Sol 得分 88.8%。作为对照,GPT-5.5 为 88.0%,GPT-5.6 Terra 为 82.5%,GPT-5.6 Luna 为 84.3%。 横向对比其它模型,Claude Mythos 5 为 84.3%,Claude Fable 5 为 83.4%,Claude Opus 4.8 为 78.9%,Gemini 3.1 Pro Preview 为 70.7%。 Sol Ultra 的成绩,也对应 GPT-5.6 的核心功能。 一方面,max 级别的推理强度让模型可以投入更多时间进行深度推理;另一方面,新增的 Ultra 模式会调度多个子 Agent,把复杂任务拆分处理,再统一汇总结果。 在真实开发场景里,模型经常需要理解项目结构、读取文件、修改代码、运行命令、分析报错、继续修改。一个复杂任务通常无法靠一次回答完成。Ultra 模式的方向,是让多个子 Agent 分别处理不同环节,再把结果汇总起来,从而提高复杂任务的完成效率。 生物方向上,GPT-5.6 Sol 的提升体现在 GeneBench v1 上。这个评测主要面向长周期基因组学和定量生物分析任务。OpenAI 称,Sol 相比 GPT-5.5 取得了更强结果,而且使用的输出 tokens 更少。 这一点对科研场景尤为关键。生物信息学、基因组学和定量生物分析,经常需要模型持续分析数据、解释结果、选择方法、比较假设,并在多轮操作中保持上下文一致。模型能不能完成这类任务很重要,能不能用更低 tokens 成本完成长链条分析同样重要。 如果 Sol 能在更少输出 tokens 下取得更强结果,意味着它在专业科研工作流中有更好的成本效率。对实验室、企业研发团队和生物医药场景来说,tokens 消耗直接影响调用成本,也影响模型能否进入大规模工作流。 网络安全则是 GPT-5.6 Sol 最敏感的能力方向。 OpenAI 称,Sol 是其迄今最强的网络安全模型,能够推进长周期安全任务的性能和效率边界,包括漏洞研究和 exploitation 相关任务。 在 ExploitBench 上,GPT-5.6 Sol 的表现接近 Mythos Preview,但只使用了大约三分之一的输出 tokens。 同时,OpenAI 还提到 ExploitGym——一个由 UC Berkeley 联合多家前沿实验室打造的评测体系,用于衡量模型在安全任务中的能力。随着推理能力提升,Sol、Terra、Luna 在这一领域都有明显进步。 不过,OpenAI 对这部分表述明显踩了刹车。 官方强调,Sol 更擅长发现和修复漏洞,还不能稳定完成端到端攻击。在涉及 Chromium 和 Firefox 的评估中,Sol 可以识别 bug 和程序缺陷,也就是漏洞利用的基础组件,但在测试条件下没有自主生成可运行的完整攻击链。 基于这些结果,OpenAI 判断 GPT-5.6 Sol 尚未跨过 Preparedness Framework 中的网络安全关键风险阈值。 ▲System Card :https://deploymentsafety.openai.com/gpt-5-6-preview/introduction 这种踩刹车的判断显然是为了避免重走「Mythos」的老路。 一方面,OpenAI 要证明 Sol 在网络安全任务上确实强了很多;另一方面,它也要说明 Sol 还没有达到必须极端限制的风险级别。更讽刺的是,这种压力很大程度上来自 OpenAI 自己参与塑造的 AI 行业炒作叙事。 与此同时,OpenAI 也承认,基准测试无法覆盖所有现实用法。没有任何评测可以代表所有产品配置、多步骤攻击和真实工作流。模型可能被接入其他工具,也可能被放进更复杂的攻击链条里。正是这种不确定性,让 GPT-5.6 的发布方式变得格外谨慎。 性能最强,但戏份却给了 AI 安全 GPT-5.6 的发布说明中,安全罕见地占据了较大篇幅。 OpenAI 为 Sol、Terra、Luna 配置了分级防护体系,能力越强,防护越严,目标是在压制攻击性用途的同时保留代码审查、漏洞研究等合法场景。 模型层面,系统被训练为拒绝违规网络安全请求,即便用户尝试伪装或绕过。生成阶段引入实时分类器,对高风险内容进行检测与拦截,必要时交由更强模型复核。账号层面则结合跨对话行为与风险信号,识别持续性滥用。 这套机制被称为分层安全栈,涵盖模型拒答、实时检测、账号审查、差异化访问与持续测试。多层协同用于应对复杂滥用,同时尽量减少对正常工作的干扰。 面向企业客户,OpenAI 还提出了隐私保护检测、自主安全控制以及风险分级访问等方案,试图在安全与数据保护之间找到平衡点。 为了避免重蹈覆辙,OpenAI 在自动化红队测试上投入了超过 70 万 A100 等效 GPU 小时,重点寻找通用 jailbreak(越狱),并辅以专家人工测试。OpenAI 还建立快速响应流程,对新漏洞进行复现、评估与修复,并纳入持续评测体系。 可用性方面,GPT-5.6 目前仍处于有限预览阶段。 OpenAI 表示,模型将先通过 API 和 Codex 向一部分可信合作伙伴开放,随后再逐步扩展到 ChatGPT、Codex 和更广泛的 API 用户。 同时,OpenAI 也强调,自己相信前沿模型应该尽可能广泛地开放,并计划在未来几周内,让 GPT-5.6 Sol、Terra 和 Luna 进入更普遍的可用状态。 ▲ 看起来评价不太妙 价格体系也同步公布: 按每百万 tokens 计费,Sol 输入 5 美元、输出 30 美元;Terra 输入 2.5 美元、输出 15 美元;Luna 输入 1 美元、输出 6 美元。 同时,GPT-5.6 引入了更可预测的 prompt caching 机制,支持显式 cache breakpoints,并提供至少 30 分钟缓存生命周期。缓存写入按未缓存输入价格的 1.25 倍计费,读取则享受 90% 折扣。 当然,想要用上还需要一些时日,OpenAI 宣布 GPT-5.6 Sol 将在 7 月登陆 Cerebras,最高速度可达每秒 750 tokens。这个版本初期同样只面向部分客户开放,后续会随着容量扩展逐步放开。 换句话说,GPT-5.6 的「有限预览」并不只是产品灰度发布,更是一套安全验证流程。OpenAI 需要在能力、风险与开放之间,找到一个可控的平衡点。 前沿模型发布节奏,进入新周期 两周前,Anthropic 停用了其最强模型之一 Fable 5,因为美国政府要求该公司限制美国境内外外国公民使用相关模型,理由是国家安全。 而在 GPT-5.6 的发布流程中,第一批使用用户同样不完全由 OpenAI 自己决定。 OpenAI 在官方博客中披露,在发布前已向美国政府展示 GPT-5.6 的能力与发布计划。根据美国政府要求,模型将以有限预览形式上线,仅向少数可信合作伙伴开放,并且这些合作伙伴的信息已与政府共享。 《华盛顿邮报》的报道提到,美国联邦政府将审核哪些公司可以访问 OpenAI 的最新技术。且目前只有获得美国政府批准的公司可以访问新模型,个人用户没有申请通道。 彭博社则报道称,GPT-5.6 首批开放对象约为 20 家合作伙伴,其中一个入口可能是亚马逊的 Bedrock 平台。 对此,OpenAI 的态度显然是有些模棱两可。OpenAI 在博客中表示,不认为美国政府参与模型访问流程应当成为长期默认机制,因为这会让最好的工具远离用户、开发者、企业、网络防御者和全球合作伙伴。 但现实是,OpenAI 仍选择接受这一安排,理由是希望争取更广泛开放,同时与美国政府共同制定一套可复制的模型发布流程。 这一变化背后,是前沿 AI 模型逐渐被纳入国家安全框架。 过去,新模型发布主要是公司产品节奏问题。现在,一旦模型在编程、网络安全、生物和代理式工作流上跨过新的能力区间,发布节奏就可能被纳入安全和出口控制讨论。 对 OpenAI 来说,GPT-5.6 既是一次旗舰模型预览,也是一次政策试探。OpenAI 需要证明 Sol 足够强,也需要证明安全体系足够严密,还要在美国政府审查和商业开放之间找到可执行路径。 如此复杂的发布流程,某种程度上也「剧透」了前沿 AI 未来的魔幻走向:当模型能力逼近关键阈值,使用资格与使用方式,将成为比性能更为关注的事项。
GTA 6 没有杀死实体游戏,因为它已经死了
千呼万唤始出来,《侠盗猎车手 VI》(下文简称 GTA 6)终于在今天开启预购,你买了吗? 当不少苦等已久的粉丝迫不及待打开官网和游戏商店准备第一时间拿下游戏时,映入眼帘的价格恐怕会泼上第一盆冷水: 港区标准版定价 568 港币,折合人民币约 493 元;终极版 708 港币,折合人民币约 615 元。 这还没完,开发商 Rockstar Games 还宣布,GTA 6 的实体版本,只会在包装盒里提供一个下载码。 作为游戏行业的绝对标杆,GTA 6 的一举一动都极具象征意义,开了「80 刀」和「下载码」的先河,未来效仿的 3A 游戏,只会越来越多。 实体游戏,正在死去 关于 GTA 6 「实体版」名存实亡的原因,Rockstar Games 暂未正面回应。 有不少媒体猜测,仅提供「数字版」,很可能是为了防止游戏偷跑,保证所有玩家都只能在同一时间解锁游戏。 所以,游戏首发后,R 星会不会推出真正意义上的实体版,还真不好说。目前有消息称,GTA 6 的光盘版本将于 12 月推出。 只是,会预购游戏的玩家,大部分都希望能第一时间玩上游戏,本来就倾向于数字版,会预购实体版的,当然还是希望可以顺便充当收藏,下载码明显没有太多收藏价值。 更多人认为,GTA 6 的游戏文件体积过于庞大,可能高达 300GB,而光盘实体介质成本太高。 但无论 GTA 6 最终有没有光盘版,实体游戏之死已不可避免,这是主机厂商和游戏厂商的一次共谋。 游戏体积越来越庞大,介质成本自然也水涨船高,特别是因为掌机形态不得不用卡带的任天堂,价格本来就比光盘贵上不少,上限也只有 64GB,已经不太适合巨大的第三方游戏。 于是才会有「钥匙卡」这种略显别扭的介质出现,保留了卡带实体的形式,但游戏本体需要下载。某种意义上,厂商做游戏的一部分成本被转嫁给了用户,任天堂至少守住了二手游戏的流通市场。 特别是去年年底开始的存储涨价潮流,游戏行业自然不能幸免,原本不便宜的游戏卡带更加雪上加霜,一些明明可以放进传统卡带的游戏,也更青睐便宜的钥匙卡了。 光盘的价格虽然要远低于卡带,但作为一个实体产品,也会产生生产、成本、仓储的额外支出,在这个游戏研发投入越来越高的当下,自然要开源节流。 之所以光盘能成为理想的游戏载体,也是因为它是性价比最高的实体存储媒介,这个逻辑是基于游戏流通主要依靠线下渠道的逻辑。 而当网络普及、Steam 走通了游戏数字交易的模式之后,主机厂商当然能嗅到这背后更大的利润空间—— 不仅没有渠道和物流这些「中间商」,二手市场也不复存在,平台还能直接从中抽成。 索尼的 PS Store 收取 30% 的费用,远比以往从光盘授权费赚得多了,于是 PS5 Pro 直接砍掉了光驱。 2020 年,实体游戏占索尼游戏部门收入的 6%,次年下降到 5%,到 2024 年,这个数字只剩下 3%。 甚至,连「流媒体」这种数字时代的商业模式,也来到了游戏领域。每个月订阅一个 Xbox Game Pass,就能玩游戏,连「购买」都不需要。 实体游戏死了,但不是 GTA 6 动的刀子,游戏厂商和主机厂商在几年前就已经动手了。 GTA 6 被推上风口浪尖,仅仅因为树大招风,它只是给实体游戏的棺材,又钉了几颗钉子。 市场不景气,先对实体游戏开刀 这几年,跟「实体游戏」的消息,总是在撩动着玩家敏感的神经,一点风吹草动,都会引发玩家的口诛笔伐,很多社群都纷纷呼吁「抵制」钥匙卡和实体下载码这些行为。 位于北美的游戏零售商 Loot Box Gaming US 和 Video Games Plus,都宣布将拒绝销售只包含下载码的 GTA 6 实体版,强调实体游戏所有权的价值和玩家利益。 但和手机都 LCD 屏幕和小屏机一样,沉默的大多数已经适应了这种变化。 上个月,Square Enix 和 Capcom 两家游戏大厂发布财报数据,数字游戏销量占总销量比例分别为 81% 和 93%。同时期的索尼财报也显示,有 85% 的 PS5 和 PS4 游戏都是通过数字方式购买的。 著名美国电子游戏零售公司 GameStop,也在今年年初宣布永久关闭约 300 家门店,公司也一直在挣扎转型。 在实体媒介在各种领域都基本消亡之后,游戏也不可能例外。 以前的游戏主机,确实有可能完全不需要用户部署网络,但现在,即使是实体游戏盘也未必有全量的游戏文件,游戏到手免不了下载更新,不上网基本玩不了。 这种变化,也让「实体游戏盘 = 游戏物理归属权」的等式失效,即使游戏盘能保存很久,当在线服务消失之后,无法更新、下载完整的游戏本体,依然玩不了游戏。 人人都能联网、都要联网,推行在线游戏商店的阻力基本消失,迈向全面数字化难以避免。 主机游戏,正处于一个比较糟糕的历史节点,以往那种补贴卖主机的商业模式,因为硬件成本飙升,已经处于崩溃边缘。 不仅 Switch 2、PS5 这些现存的主机都已经宣布涨价,分析师还预测,按照现在的元器件成本,次世代的 PS6 和 Xbox 主机,价格都会轻松越过 1000 美元。 主机厂商利润率极速收缩,游戏机越卖越亏,甚至越亏越多的条件下,当然只能进一步寄希望于游戏的盈利能力。 但游戏的产量低,利润率高的大作更是急不来,于是只能尽力榨取单个游戏的商业价值,不仅价格进一步上探,还得靠数字商店的方式开源节流,消灭二手市场,力求将每一个玩家变成「消费者」。 于是,十三年磨一剑的话题大作 GTA 6,就以一个高昂的价格,和数字版的姿态降临了——一方面,GTA 6 的主机独占策略 ,代表了主机游戏仍具备其独特价值,但另一方面,80 刀下载码的 GTA 6,也是游戏行业无奈的现实映照。 实体游戏,会变成什么? 我们为什么会喜欢实体游戏? 除了即插即玩、能出二手这些物质上的好处,还有很多发烧友,热衷于收藏这些实体游戏。 即使卡带盒子里只有一张下载码,GTA 6 实体版还是已经在 Amazon 商城上售罄了,看来还是有不少玩家,希望能在自己的收藏架子上,摆上这个游戏——即使只是一个空壳。 成为一个符号,就是实体游戏的归宿。 这样的变化,已经在音乐行业上演。现在的歌手发专辑,还会同步宣布一大堆不同配色的唱片,粉丝未必有唱机,但他们都会选择买来收藏、摆放。 音乐、游戏、电影这些内容,本质上只是电流和代码,实体游戏和唱片,就成为了触碰它们的一种方式。 通过周边化,黑胶唱片在这几年成功迎来复兴,但游戏卡带,恐怕难以复制这种模式。 唱片很大,可以有不同的色彩,这几年还有各种新工艺,让唱片本身就有美学价值,但小巧的卡带和光盘,工具属性明显大于玩具属性,很难迎来这种蜕变,渐渐式微不可避免。 就像酒吧墙上的黑胶唱片一样,游戏卡盒终将从「媒体介质」变成一种「文化符号」。 它会成为冰箱贴、装饰品,进入客厅、书房和收藏柜,却唯独,渐渐离开游戏机本身。 以《宝可梦》卡带盒为图案的冰箱贴 作者|苏伟鸿 编辑|肖钦鹏

版权所有 (C) 广州智会云科技发展有限公司 粤ICP备20006386号

免责声明:本网站部分内容由用户自行上传,如权利人发现存在误传其作品情形,请及时与本站联系。