行业分类:
加载中...
头条分类:
加载中...
马斯克旗下X平台与广告商达成和解,结束长达数年的法律纠纷
IT之家 7 月 30 日消息,马斯克旗下的 X 平台与广告行业组织世界广告主联合会(WFA)结束了持续多年的法律纠纷,双方于当地时间周三宣布达成和解。 这项和解协议结束了马斯克此前试图追究广告商法律责任的激进行动。此前,部分广告商因担忧平台上的品牌安全问题而减少在 X 上的广告投入。 X 于 2024 年起诉 WFA,称该组织在马斯克于 2022 年以 440 亿美元(IT之家注:现汇率约合 2980.4 亿元人民币)收购这家社交平台后,对 X 发起了所谓“系统性的非法抵制”,平台广告收入因此下滑。X 指控参与这一行动的企业包括玛氏(Mars)、CVS Health、壳牌(Shell)、乐高(Lego)等多家公司。这些广告商否认相关指控,并表示品牌有权自主决定广告投放渠道。 今年 3 月,美国联邦法院驳回了 X 的诉讼。一名法官表示,X 未能证明自己根据联邦竞争法遭受了实际损害。X 随后于 4 月提出上诉。 双方联合声明称:“今天,世界广告主联合会(WFA)和 X 公司结束了围绕全球负责任媒体联盟(GARM)的相关诉讼。这标志着两家机构关系的新起点。” X 此前指控,广告商减少广告投入的原因,是因为 WFA 旗下全球负责任媒体联盟(GARM)制定的相关指导原则。GARM 是由品牌方和广告代理机构组成的联盟,旨在制定行业标准,避免广告出现在有害网络内容旁边。 在马斯克调整平台内容审核政策后,广告商曾担心自己的品牌广告会与社交网络上的有害内容同时出现,从而影响品牌形象。 联合声明表示:“WFA 重申其对言论自由的承诺。这一原则早在 1953 年 WFA 成立之初就被写入其章程,也是 WFA 与 X 共同认可的原则。2024 年 8 月 9 日,WFA 停止运营 GARM。WFA 不会重新成立或恢复 GARM,也不会推出类似的倡议。WFA 与 X 均认为,品牌方、平台以及消费者都将从品牌安全领域的创新中受益。” 这场诉讼并不是马斯克与广告商之间唯一的冲突。在收购 X 后,面对暂停广告投放的广告主,马斯克曾公开表示:“去他妈的(go f*** yourself)。”
研究显示:AI聊天机器人实施情感诈骗的能力已超越人类
IT之家 7 月 30 日消息,网络恋爱诈骗是互联网世界中历史最悠久的骗局之一,但至今仍不断有新的受害者上当。由四所大学联合开展的一项研究显示,如今 AI 聊天机器人实施这类诈骗的效果甚至已经超过真人,这一结果令人担忧。 如今,恋爱诈骗通常始于交友软件。骗子会使用极具吸引力的个人资料,扮演一位热情主动、各方面都符合受害者理想对象标准的追求者。 随后,骗子会与受害者进行长时间的线上交流,这一过程通常持续数月。他们往往以“长期在海外出差”或“人在国外旅行”为借口,解释为什么无法尽快见面。 当双方建立起足够的信任后,骗局通常会进入两个方向之一:一种是骗子谎称遭遇突发状况,急需资金摆脱困境;另一种则是向受害者炫耀自己投资获利丰厚,并诱导对方向虚假的加密货币投资项目转账。 据IT之家了解,这类骗局被称为“长期骗局”(Long Con),因为其依赖于长期建立信任关系,骗子往往会连续数月每天与受害者聊天。虽然这种方式看起来需要投入大量时间,但实际上,这类诈骗通常由位于柬埔寨、缅甸和老挝等国的诈骗园区实施,参与者大多收入微薄,甚至有人是被拐卖后被迫从事诈骗活动。 据《Wired》报道,这项研究由印度阿姆里塔大学(Amrita Vishwa Vidyapeetham)、意大利威尼斯福斯卡里大学(Ca' Foscari University of Venice)、澳大利亚墨尔本大学以及以色列内盖夫本-古里安大学(Ben-Gurion University of the Negev)的研究人员共同完成,测试对象包括 ChatGPT、Claude 和 Gemini 等 AI 聊天机器人。 研究人员让 AI 聊天机器人与真人骗子分别参与模拟恋爱诈骗流程,更准确地说,是模拟诈骗前期通过长期聊天建立信任,并最终诱导受害者投资虚假项目的过程。 研究结果显示,AI 聊天机器人表现得极为出色,不仅成功伪装成真人,在部分指标上的表现甚至超过了实验中的真人“骗子”。 参与实验的受试者并不知道研究的真正目的,他们始终认为自己聊天的对象是真人,无论实际对方是 AI 还是人类。研究人员通过主观评价和客观测试两种方式衡量双方建立信任的程度。 当聊天进行到最后,研究人员以“下载一款应用程序”等请求测试受试者时,由真人逐步建立信任关系的情况下,仅有 18% 的受试者同意;而当聊天对象实际上是 AI 时,这一比例接近一半。 此外,当受试者被要求评价自己对聊天对象的信任程度时,AI 聊天机器人获得的评分也明显高于真人。 《Wired》就研究结果联系了 Anthropic、OpenAI 和谷歌。OpenAI 和谷歌均未作出回应,而 Anthropic 发言人在声明中表示,公司政策明确禁止利用 Claude 从事诈骗或冒充真人等行为,同时也部署了多项技术防护措施,以防止诈骗分子利用 Claude 实施欺诈。 研究人员认为,这项研究最令人担忧的地方在于,如果诈骗团伙用 AI 聊天机器人取代真人客服,诈骗中心的运作规模将实现大幅扩张。 AI 骗局机器人可以同时与数千名潜在受害者展开对话,而无需大量人力。只有在最后一步,即诱导受害者转账汇款时,诈骗团伙才可能需要真人介入,以绕过 AI 系统自身设置的安全限制。
HBM明年要涨87%!三星七成产能锁单五大科技巨头
快科技7月30日消息,三星电子在今日的二季度财报电话会上放话:计划把总产能的六到七成通过长期供货协议(LTA)供应给客户,目前已和五大全球数据中心客户签约,还有五家AI相关大客户在最终谈判。 这五大客户被业界解读为亚马逊AWS、微软、谷歌云、Meta和Oracle,正好是全球头部科技巨头。 所谓长期供货协议(LTA),就是把未来几年的内存产能提前锁定给买家,抢在AI需求爆发前卡位。 为防客户中途跑单,三星下了狠手,合同一签就是五年,还用滚动续约机制每年叠加年限,并附带大额多年预付金(相当于定金),三星透露,预付金约四分之一已经到账,随新合同落定还会继续增加。 这波操作正对高盛的判断,高盛在29日的会议纪要里分析,AI服务器需求同时推高传统DRAM和高带宽内存(HBM)价格,传统DRAM三季度环比将双位数上涨,四季度可能再来一轮双位数。 HBM更猛,高盛预计三星HBM平均售价2027年同比暴涨87%,远超彭博共识的52%。 高盛点名LTA的约束力是HBM涨价的核心推手,现有合同里有预付金、照付不议条款和违约金,客户想走不容易,目前全球服务器DRAM供应一半以上已被长约锁死,比例还在上升。 至于中国内存厂商的激进扩产,专家认为近期威胁不大,理由是良率和技术仍明显落后于三星和SK海力士,还有HBM比等量DRAM耗更多晶圆,产能增加不等于有效供应增加,这从结构上托住了内存价格。 三星对HBM信心十足,HBM4(第六代)下半年放量,三季度HBM4营收环比增超三倍,下半年占HBM总营收超60%,目标把HBM市占率追到DRAM的水平(约38%)。
携程回应万元国际机票退票争议:已按六重保障全额补偿
凤凰网科技讯 (作者/杨睿琪)7月30日, 针对近日引发广泛关注的“1.5万元国际机票退票仅退款432元”事件,携程旅行网今日发布详细情况说明,公开事件全貌及处理结果。 据携程披露,涉事用户于7月4日预订7月16日北京飞纽约的国航CA981航班,票款15159元。该机票退票规则已公示(含亮色感叹号强提醒)显示“仅部分税费可退”。用户7月13日在APP自助退票,系统按航司规则自动处理。其后用户致电申诉高额退票费,但因客票已完成退票,国航未能办理追回或改签。 关键转折在于7月27日,经进一步沟通确认,用户退票涉及此前未提及的个人突发原因,符合携程“六重服务保障”中的特殊退订保障条件。次日,平台启动该保障流程,补偿退票损失14727元,实际承担全额退款。 携程强调,此为标准化个案处理,非通用退票政策改变,日常机票退改仍严格执行航司官方规则,对所有用户标准统一。同时,携程公开“六重服务保障”范围,涵盖一站式售后、旅行预警、重大灾害保障、特殊原因退订、应急援助及先行赔付。 为提升提示透明度,携程宣布将于7月31日上线新功能:当订单可退金额低于票款20%时,将触发专属弹窗强提醒并二次确认用户意愿。 携程表示,虚心接纳各界监督,将在严守行业规则基础上持续优化信息提醒与用户挽损服务,保障用户知情权与出行权益。
分析师:Meta的人工智能战略像是在“胡乱尝试”
IT之家 7 月 30 日消息,Meta 的 AI 战略再次引发投资者担忧。这家社交媒体巨头的股价当地时间周三大跌 10%。此前,Meta 公布的财报显示,公司资本支出的增长速度远远超过了营收增长。 Meta 面临的一个核心问题是:目前大量 AI 投资尚未带来实际财务回报。根据公司第二季度财报,Meta 目前约 98% 的营收仍来自传统广告业务。 近年来,Meta 一直在尝试拓展新的业务方向,包括推出新的订阅服务、智能眼镜以及各种应用程序。此外,公司还在考虑向其他企业出售 AI 算力资源。市场研究机构 EMARKETER 高级分析师 Minda Smiley 表示,这些举措让外界难以看清 Meta 的 AI 战略重点。 她在一份报告中写道:“这些不断推出的新项目,越来越像是在盲目尝试,而不是围绕一个可持续的发展路径进行布局。” Meta 发言人向 Business Insider 表示,公司的 AI 投资正在增强业务能力,帮助团队更快完成开发,同时帮助客户提升广告效果。例如,目前已有 900 万家小型企业使用 Meta 的 AI 图像编辑工具。 该发言人还表示,自推出最新 AI 模型 Muse Spark 后,每天与 Meta AI 助手互动的用户数量增长了 60%。 IT之家注意到,在财报电话会议上,Meta CEO 马克 · 扎克伯格也强调,公司目前仍处于 AI 发展早期阶段。他表示,Meta 正在研发功能更强大的 AI 模型,这些模型未来将推动公司营收增长。同时,他还强调了 Meta 最新发布的 AI 模型在行业评测中的出色表现。 扎克伯格预测,未来将有数十亿人使用能够全天候运行的个人 AI 智能体,这些智能体可以帮助人们改善生活和职业发展。不过,他也承认 Meta 目前还没有完全实现这一目标。 华尔街的耐心正在逐渐消耗。Investing.com 高级分析师 Thomas Monteiro 在一份报告中表示,虽然 Meta 的广告收入仍保持健康增长,但这并不足以抵消不断增加的 AI 投入。 他写道:“更严峻的现实是,即使广告业务表现强劲,也无法完全覆盖未来不断扩大的支出压力。” 不过,现在判断 Meta 失败仍为时过早。在财报电话会议上,扎克伯格强调,Meta 并不只是一个广告公司。他指出,从在哈佛宿舍创建 Facebook,到如今建设大型数据中心,Meta 长期以来一直专注于自主研发技术。他说:“我们确实是一家全栈技术公司。”
OpenAI CEO奥尔特曼:过度依赖AI或致人类认知能力衰退
IT之家 7 月 30 日消息,OpenAI CEO 萨姆 · 奥尔特曼表示,人工智能(AI)一个被低估的风险是,人们可能会过度依赖这项技术来完成思考,从而导致自身的思维能力逐渐退化。 在当地时间周二播出的《Invest Like the Best》播客节目中,当被问及 AI 领域目前最重要、尚未解决的问题时,奥尔特曼表示:“我认为没有得到足够关注的一个问题是,我们将如何避免认知能力衰退?” 他进一步说道:“我们将如何使用这些工具,同时确保自己能够不断锻炼大脑,持续理解那些真正重要的事情?” 奥尔特曼发表这一观点之际,越来越多研究人员开始警告,虽然 AI 可以提升工作效率,但也可能削弱人们原本具备的职业技能和认知能力。 “从来没有任何一种工具像这样,让我们有机会把思考过程交给它完成。”麻省理工学院(MIT)研究人员 Nataliya Kosmyna 本月早些时候接受 Business Insider 采访时表示。她进行的一项初步研究发现,使用生成式 AI 撰写论文的人,随着时间推移,其表现反而不如使用谷歌搜索或完全不借助工具的人。 理论神经科学家、AI 研究人员 Vivienne Ming 曾将人们因为 AI 可以代替完成任务而放弃认知劳动的风险称为“慢性替代”(chronic substitution)。她上个月表示,反复依赖 AI 替代思考过程,可能会削弱人的认知储备,而认知储备是抵御痴呆症的重要防线。 随着 AI 工具的能力不断提升,这些担忧变得更加突出。如今,AI 已不再只是用于回答问题和生成文本,而是开始承担越来越复杂的工作,包括文件审查、研究分析、客户支持以及编程等任务。 IT之家注意到,奥尔特曼并不是唯一一位担忧 AI 对人类认知能力产生影响的科技行业领导者。 去年,法国 AI 公司 Mistral AI CEO Arthur Mensch 在接受《泰晤士报》采访时表示,AI 最大的风险可能是导致劳动者“技能退化”(deskilling)。随着人们越来越依赖 AI 搜索信息,人类可能会逐渐变得更加懒惰。 不过,在此次播客采访中,奥尔特曼对于 AI 的未来仍然保持更加积极的态度。 他描述了一个“非常神奇”的未来场景:个人 AI 助手可以全天候运行,阅读各种文件、旁听会议、回忆几周前的邮件内容,并利用夜间闲置算力生成创意,同时主动建议用户下一步应该采取什么行动。 但他也表示,即使是功能强大的 AI 模型,可能仍然难以复制那些让人类与众不同的能力。他说:“这个世界可能需要创造一个新的词,来描述人类非常擅长、但 AI 似乎仍然非常难以真正掌握的那种判断力。”
这家Agent创企融了2亿!前微软员工创业,ARR涨超5倍
智东西 编译 | 茄子 编辑 | 程茜 智东西7月30日消息,昨日,以色列AI智能体初创公司Encore AI宣布完成3000万美元(约2.03亿元人民币)A轮融资。本轮融资由Team8领投,Planven、The Garage等机构参投。值得注意的是,参与本轮融资的部分金融机构此前已是Encore AI客户。Encore AI称,本轮融资将用于扩大美国销售业务,并将平台部署到更多大型金融机构。 Encore AI是一家通过分析企业客户交互数据,训练并部署AI语音智能体的初创公司。这些AI语音智能体既可以与客服和销售团队协同工作,也可以自主运行。 Encore AI成立于2022年,最初名称为Insait IO。该公司最初专注于为金融顾问和客户经理提供推荐软件。更名为Encore AI后,该公司便将原有系统逐步扩展为面向企业客户交互场景的AI智能体平台。 Encore AI的核心技术是交互挖掘(Interaction Mining)技术。该技术通过分析企业内部优秀员工与客户之间的交互数据,提取影响业务结果的关键行为,并将这些经验转化为AI智能体能力,帮助企业自动化处理客户沟通、提升销售转化和客户服务效率。 目前,Encore AI已经拥有超过40家全球企业客户,其中大部分来自金融机构。该公司CEO Dvir Ginzburg透露,自完成种子轮融资以来,不到18个月,Encore AI的年度经常性收入(ARR)已经增长超过5倍。不过,他并未Encore AI披露具体收入规模和估值信息。 Encore AI由CEO Dvir Ginzburg创立。Ginzburg拥有几何深度学习博士背景,曾在微软担任推荐系统研究员。更早之前,他还在Meta和思科担任过软件工程师。他此前的研究方向主要围绕如何从大规模复杂行为数据中提取有效信号,而这一技术积累也成为Encore AI“交互挖掘”技术的重要基础。 ▲Encore AI创始人兼CEO Dvir Ginzburg履历(图源:领英) 一、让AI智能体学习优秀员工经验 Encore AI提供的是一套面向企业客户交互场景的AI智能体平台。与主要用于降低人工客服成本的传统客服类AI不同,Encore AI希望让AI智能体不仅完成客户沟通任务,还能够学习企业内部优秀员工的沟通方式,帮助企业提升销售转化和客户满意度。 该平台可以部署在语音、聊天、IVR(交互式语音应答)以及在线表单等客户触点中,既可以直接与客户进行交流,也可以作为员工助手,在实时沟通过程中提供回复建议和沟通策略。 Encore AI称,其智能体平台能够在数周内完成部署,无需企业进行长时间配置和调试。目前,该公司主要服务金融服务等强监管行业客户,已经拥有超过40家全球企业客户,其中大部分来自金融机构。据Encore AI透露,一家大型贷款机构客户在部署其平台数月后,实现了10倍投资回报率。 此外,Encore AI的平台还能帮助企业发现现有销售和客服流程中的不足,包括识别低效环节、客户体验摩擦点以及影响业务结果的关键问题。 Ginzburg称,其AI智能体能够学习企业内部优秀员工在客户沟通过程中积累的有效经验,包括常用话术、案例和沟通方式。部分AI智能体甚至可以复用客户经理曾讲过的笑话,或者分享客户经理讲过的故事和案例,因为这些内容已经被验证能够带来更好的客户结果。 Ginzburg谈道,他们构建的AI智能体相当于融合了企业内部多个有效沟通方法和业务经验的“行动手册”,他将这一学习与训练过程称为交互挖掘。 交互挖掘会收集企业员工与客户之间的电话录音、邮件、短信以及客户关系管理系统(CRM)数据,对完整客户交互过程进行分析,并将沟通过程拆解为不同阶段,识别哪些行为推动了销售转化、客户成功或问题解决,哪些环节导致流程失败。 ▲Encore AI交互挖掘技术(图源:Encore AI) 例如,在销售或客户服务过程中,不同员工可能在不同阶段展现出不同优势:有些员工更擅长建立客户信任,有些员工更擅长处理客户异议,也有人更擅长推动最终成交。Encore AI希望从这些历史交互中提炼有效方法,并将其转化为AI智能体能力。 二、数据不等于经验,历史沟通记录才是壁垒 随着企业AI智能体市场升温,Salesforce、SAP、Zoho、HubSpot等大型CRM厂商也正在布局企业AI智能体能力。其中,Salesforce推出了帮助企业构建和部署AI智能体的Agentforce平台,HubSpot则推出覆盖营销、销售和客服场景的Breeze AI智能平台,SAP和Zoho也在企业软件中融入AI助手能力。 不过,Encore AI认为,仅拥有客户数据并不足以复制其模式。Dvir Ginzburg称,传统CRM厂商通常并未将历史客户沟通记录作为训练AI智能体的重要数据来源,而Encore AI从成立之初就将客户交互过程作为核心数据资产。 他认为,如果大型CRM厂商希望采用类似方式,需要重新调整现有的数据采集流程、系统架构以及技术体系,将员工与客户之间的历史沟通记录转化为AI智能体学习基础。 Encore AI认为,未来企业AI竞争的关键,不只是拥有数据,而是能否从企业内部长期积累的数据中提取有效经验,并将其转化为能够持续执行的智能体。 结语:从真实业务场景提炼可复用经验或将企业AI竞争的关键 大模型正在降低AI应用门槛,但企业真正落地AI智能体仍面临一个问题:如何让AI理解具体业务流程,并具备接近优秀员工的执行能力。 Encore AI尝试通过Interaction Mining技术,将企业内部沉淀多年的客户交互经验转化为AI智能体能力。未来,随着企业数据资产价值进一步释放,如何从真实业务场景中提炼可复用经验,或将成为企业AI竞争的重要方向。 来源:TechCrunch、Encore AI
翁荔回归OpenAI,英伟达押注Ilya,AI大牛要用“AI造AI”
如果一位国人 AI 工程师,技术过硬,履历漂亮,还出身北大这样的顶尖学府,那 ta 什么都有可能做,就是不可能不上班。 前脚因为健康和生活是最重要的对齐工作,从 Thinking Machines Lab 离职的翁荔,后脚就传出重新回到 OpenAI 上班。据公司发言人透露,她将领导一支加速内部研究的团队,参与 OpenAI 对递归自我改进的探索,也就是让 AI 参与训练、改进自己的下一代模型。 无独有偶,她的前同事、另一位曾经 OpenAI 核心人物 Ilya Sutskever 创办的 Safe Superintelligence,也终于从密不透风的研究中露出了一条缝。英伟达在获得罕见的内部研究访问后,决定向 SSI 投资,并用新一代 Vera Rubin 系统将其算力扩大一个数量级。 英伟达确信,SSI 过去两年一直在推进一条不同于现有大模型路线的新研究方向。对此,Ilya 没透露更多,只说了一句:我们有值得扩大规模的研究。 好奇群众一下子更来劲了,社交媒体上出现了一篇对公开线索的逆向分析,推测 SSI 寻找的并不是下一套更大的预训练配方,而是一种新的迭代和进化方式:让模型不只在训练完成后静止不动,而是在反馈、实验和持续学习中不断产生更强的下一代。 这个判断没有得到 SSI 确认,但它与 Ilya 过去一贯的主张高度一致。他此前多次表示,单纯依靠更多数据和算力的 scaling 时代正在接近边界,AI 需要重新学会像人一样,用较少经验形成更深理解,并在与环境的互动中继续成长。 这些已经相当功成名就的头部AI人才,似乎都在看往同一个方向:怎样让 AI 替自己研发下一代 AI。 自我进化不是 AI 半夜重写大脑 提到递归自我改进,很容易联想到一个科幻画面:AI 突然意识到自己的缺陷,直接修改神经网络权重,醒来时已经比昨天聪明十倍。 现实中的起点要朴素得多。AI 研发本来就是一条不断循环的流水线:研究员阅读论文和实验记录,提出一个假设,修改训练代码,排队运行实验,等结果出来后比较指标、寻找失败原因,再设计下一轮方案。 今天的大模型已经可以参与其中很多环节,它能阅读代码库,复现论文,编写实验脚本,调用算力运行测试,整理几十组结果,分析哪一个参数可能出了问题,然后继续修改代码。过去一支团队几天完成一轮的工作,未来可能由多个智能体并行尝试几十条路线,再把最有希望的结果交给人类判断。 翁荔在 7 月初发布的长文《Harness Engineering for Self-Improvement》,几乎提前写出了她即将负责的研究方向。她认为,近期最现实的自我改进路径不是模型直接重写大脑,而是让 AI 先学会改造自己的工作环境:自动分析失败记录,调整上下文管理、工具调用和工作流,再通过新的实验结果继续优化这一套系统。更成熟的 harness 可以推动自动化研究,更强的模型又可以反过来把 harness 变得更简单,二者形成循环。 这也让翁荔与 Ilya 的两条路线出现了有趣的呼应:OpenAI 更像是在把现有研发流程逐步交给 AI,让它先成为一名能够工作的研究工程师;SSI 则可能试图从更底层寻找新的学习范式,让模型本身具备持续迭代和进化的能力。 AI 并不需要一开始就有能力直接修改自己的权重。只要它能改善训练流程、筛选数据、设计评测,或者优化包裹在模型外面的 harness,就已经在参与制造自己的继任者。 前者从工程循环往里走,后者从模型机制往外走,目标都是缩短一代 AI 到下一代 AI 之间的距离。 同时,千人联名请愿放慢速度 就在大牛们想要加速押注这条路线时,行业内部出现了另一种声音。 本周,超过 1100 名来自 OpenAI、Anthropic、Google、Meta 等公司的从业者联署声明,要求提前建立能够控制自动化 AI 研发速度的技术与协调工具。参与者中包括 OpenAI 首席科学家 Jakub Pachocki、Anthropic 联合创始人 Jack Clark 和 Jared Kaplan 等高级研究者——以及,Ilya 本人。 请愿并没有要求停止 AI 研究,甚至没有否认自我改进可能带来的价值。它担心的是,一旦 AI 开始显著加快 AI 研发,能力增长可能快过人类理解和控制系统的速度。 仔细想想,这种看似矛盾的反复横跳,来自于同一群人,甚至同一个人。同一时间,就可以做出两种判断:他们既相信自动化研究可能是 AI 下一次飞跃的关键,也相信一旦这条反馈回路真正运转,行业必须拥有在必要时减速的能力。 因为这套循环一旦形成,就与过去发布一款更强模型不太一样。过去的进步速度最终受制于人类研究团队。人要提出问题、安排实验、判断结果,进度也会因为预算、人力和组织流程停下来。 自动化 AI 研发的目标,正是逐步拿掉这些瓶颈。模型越强,越能帮助团队更快造出下一代模型;下一代模型又会成为更好的研究员,进一步缩短下一轮研发时间。 要进步,也要控制速度 因此,尽管看似矛盾的两股力量,其实共享同一个前提:自动化 AI 研发正在从遥远设想变成一项具体的工程目标。 翁荔回到 OpenAI,说明递归自我改进已经开始获得专门的组织和负责人;英伟达愿意在看过 SSI 秘密研究后投入巨额资金和最新算力,说明新的学习路线至少已经到了值得扩大验证的阶段。 请愿者要求准备刹车,也不是因为他们认为这条路线不会成功,恰恰是因为他们开始认真考虑它成功以后会发生什么。 真正的分歧不在于 AI 应不应该帮助人类做研究。代码生成、论文检索和实验自动化早已进入实验室。而在于,当 AI 从一件提高研究员效率的工具,逐渐变成能够自行提出方案、运行实验、评价结果并修改下一轮流程的研究系统时,人类应该在哪些节点保留决定权。 这意味着一系列需要讨论的问题:谁来设定它优化的目标?谁来判断一次看似提高跑分的修改有没有破坏安全边界?当多个实验室都处于竞争中,哪一家公司愿意单独暂停一次有效的迭代?,如果模型的研发周期真的从一年缩短到数月、数周,外部评估和内部安全团队还能不能跟上? AI 公司现在争夺的早就不只是造出爆款模型,它们正在争夺一套能够持续制造更强模型的研发系统。 一边是 Ilya 和翁荔这样的顶尖研究者,希望找到新的迭代方式,让 AI 参与自己的进化;另一边,是同一行业里的上千名研究者要求提前准备一套减速机制。两种立场之间,阵营随时变化,态度也并不针锋相对,所有人都面对着一道共同的难题:当研究工具开始加速研究本身,谁还能决定下一代 AI 应该在什么时候到来?
吞并飞书,豆包成“豆办”
在阿里钉钉大调整后,字节麾下的办公软件飞书也迎来变局——豆包联手火山引擎,“吞下”了飞书。 7月30日,字节发布内部邮件,宣布豆包与飞书各自的产品团队将整合,成立新的豆包产品团队,由豆包负责人赵祺负责,飞书负责人谢欣向其汇报。 此外,飞书GTM(市场、销售及客户服务)体系将与火山引擎团队整合,成立新的GTM组织“创造力服务平台”,整体负责字节MaaS和SaaS板块的相关工作。 新部门将由火山引擎负责人谭待负责,飞书销售负责人林婵、飞书战略及市场负责人史志隽向谭待汇报。 经过这番调整,飞书多个部门的汇报线被挪到豆包和火山引擎相关负责人下面。这块曾经与抖音、火山引擎并列的业务,正在被拆散、融合到姊妹业务中。 字节方面表示,重组之后,原有的飞书产品和服务保持不变。飞书还将和豆包在生产力场景进行更深度的产品协作。 另有消息称,由飞书产品团队深度参与开发的豆包企业版,已经在部分飞书客户中开启内测。 一个月前,豆包已经尝试与飞书牵手。它的聊天功能可以添加飞书好友,两者的账号也实现了打通。这些动作被视为豆包增强AI办公能力的举措。 如今,随着双方产品团队的整合,豆包在中重度办公、协同办公方面的短板有望得到补齐。这款以chatbot起家的AI App,迈出了成为超级AI App的关键一步。 纵观全球AI行业,豆包整合飞书这样的操作,并不少见。甚至可以说,AI聊天应用整合AI垂直应用,已经成为科技行业的潮流所向。 今年以来,国内的OpenAI、Anthropic、谷歌,国内的阿里等大厂,都在给各自的chatbot App增添更多功能模块,主要手段就是“兼并”自家的垂直应用。 同时,被chatbot揽入怀中的垂直应用,往往会被“带飞”。 比如,在被纳入ChatGPT中,OpenAI旗下的编程应用Codex一扫往日萎靡,5个月内整体用户规模扩大逾7倍,与ChatGPT Work的合并周活跃用户在数日内突破800万。 如今,豆包也走上了相似的道路,张一鸣再度摸着奥特曼过河。 AI办公并不是豆包的传统强项。但字节此番让豆包牵头整合飞书,态度很明显:豆包将成为字节AI办公的主攻手。 字节此举,折射出今年AI行业的一个醒目趋势:chatbot正在经历一场大转型。 先是谷歌,它在今年4月把个人AI研究助手NotebookLM整合到Gemini里面,7月又将其更名为Gemini Notebook,主要充当Gemini的内置知识库。 谷歌上面的举动还算是小打小闹。以AI编程闻名天下的Anthropic,同样尝试把chatbot和其他AI能力绑定。 今年5月,Claude桌面端整合Chat、CoWork和Code三大模块,分别对应chatbot、通用Agent和AI编程三大场景;7月还上线了移动端和网页端。 与之相对应,7月10日,OpenAI上线新版ChatGPT桌面端,整合Chat对话、Work生产力、Codex编程三大工作场景,原本独立的Codex桌面应用就此停止独立运营。 不难看出,AI大厂的想法是:AI办公固然好,但最好是在chatbot这个流量入口里操作。 背后原因是,chatbot的几个根本优势,是其他形态的AI产品无法替代的。 时至今日,chatbot仍然是最符合直觉、用户最多的AI服务打开方式。头部App中,ChatGPT的周活跃用户多达10亿,豆包MAU也达到3.82亿。 同时,chatbot的软件安装、学习成本和使用门槛非常低,随便一部智能手机装上App、打开网站就能用。相比之下,AI编程应用、“小龙虾”或是其他智能体都需要专业人员部署一番,对设备性能和软件环境也有要求。 更关键的是,chatbot的生态兼容性极强,各类垂直服务既可以作为Agent入驻,也能直接提供链接跳转。而在Agent平台上,开发者想要嵌入其他功能,往往需要费一番周折。 因此,chatbot虽然听上去有些“老登”,但无疑仍是AI公司拓展服务矩阵的最佳载体。 另一方面,接管AI办公,则是chatbot迈向超级AI App必须跨出的一步。 chatbot并非尽善尽美,最大问题就是不容易赚钱。尤其是Agent时代到来后,chatbot往往会增添众多Agent模块,token消耗量几十、几百倍增长,收入却止步不前。哪怕家大业大如字节,也扛不住这么烧钱。 收会员费,是chatbot创收的常规选项之一。不久前,豆包开卖付费会员套餐,标准版68元/月、加强版200元/月、专业版500元/月。 相对应地,豆包也提供了一些专属会员权益,包括高峰期优先使用、更强大的工作任务模型、更多图片视频生成次数,等等。但问题是,这类权益基本在chatbot场景内打转,付费吸引力可想而知。 如今,通过与飞书进行产品整合,豆包能够为收费找到更多的卖点。 它的生产力场景可以从个人轻办公跃入中重度办公,乃至公司层面的协同办公;同时,飞书在办公场景的落地经验和资源更加丰富,可以帮助豆包在B端快速打开市场。 以chatbot“托举”AI垂直应用,同时整合AI垂直应用为chatbot创造更多“氪金点”,是OpenAI等公司已经跑通的路径,也是豆包和字节正在尝试拓宽的新打法。 字节此次调整的另一个有趣之处在于,它并不是把飞书完全划到某一个业务板块下,而是分别让豆包和火山引擎掌管一部分,同时又保留了飞书的独立发展。 这一复杂选择背后,是字节对于这三块业务的战略站位的再度校准。 在字节体系的AI语境下,豆包主攻 AI to C,飞书发力AI to B,火山引擎则提供算力和模型基座。理论上,三者应该在业务上密切配合,在商业上相互承接和转化,形成一股合力。 但在多重因素影响下,这一美如画的局面并未成真。过去几年,三大业务虽然也有配合,但基本上各走各的路,谈不上有多么亲密无间。 这种略显割裂的状态,在AI办公上体现得尤为明显。 字节并非不想做AI办公,却面临一个几乎无解的难题:产品太多,场景快不够分了。 豆包主打轻办公,又通过专业版试图向中重度办公延伸;飞书长期占据中重度和协同办公,最近又在发力aily,往AI办公的概念靠拢。除此之外,刚刚更名的TRAE Work也蓄势待发,希望从AI编程切入,覆盖更多场景。 普通打工牛马究竟该选哪个产品?恐怕字节自己也说不清楚。 更要命的是,字节AI办公矩阵看似强将如云,实际上没有一个能够杀穿全链路。 豆包的办公能力偏轻,且不具备协同能力,无法真正进入企业干活。飞书嵌入企业组织,却过于依赖云端,而且用户被牢牢锁定在飞书生态内。不同软件账号不通、数据不通、能力不共享,用户要同时装多个客户端,体验割裂。 商业化层面同样如此,飞书有自己的销售团队卖办公席位,火山引擎有自己的销售团队卖云和MaaS,豆包则基本没做企业销售。倘若同一个客户对接多个部门的销售,不仅客户体验差,也卖不出高客单价。 各走各的路,导致每个人的路都不好走——这是字节三块业务此前的最大阻碍。只有首先扫除组织层面的不合理,三大业务才能在AI办公这块有更大作为。 因此,字节此番尝试破局,并不是说把AI办公完全“托付”给某一块业务,而是先理顺人事关系。集体被-1的飞书管理层,显然做出了最大的“牺牲”。 这样的“牺牲”无疑是必要的。 在产品层面,豆包和飞书要想联手攻下AI办公,就必须统一规划和行动,避免“重复造轮子”式的资源浪费。 两块业务天然互补——豆包扎根于C端,擅长轻办公;飞书则在B端经验丰富,可以承接更高阶的办公需求。两者本来就没必要互相“代劳”,而是融为一体、顺畅流转。 理想中的场景应当是:打工人平时用豆包处理文档、做PPT、查资料,需要协作时,能够一键将办公上下文和关键信息挪到飞书,在组织内部继续完成工作。 至于火山引擎,它大体上接管了飞书的销售体系,其逻辑与豆包接管产品一致。 B端生意尤其讲究统一的营销手法和销售策略。同一类生意拥有两套销售人马,不仅浪费资源,也会导致内部“打架”。火山引擎把这一块接过来,从商业化这一侧解决了潜在冲突。 豆包、飞书和火山引擎配合不畅的问题,并非最近才出现。但字节直到今天才算基本解决,折射出大公司的内部协调并不轻松,甚至要比创业公司付出更大耐心才能取得进展。 豆包联手火山引擎整合飞书,堪称字节AI今年以来的最重要调整,也是其进一步提升AI to B战略优先级的关键一环。 在C端收入尚未形成规模的情况下,AI to B已经成为字节AI商业化的主攻方向,而主要路径就是以MaaS服务卖token。 有消息称,按7月平均消耗口径统计,字节大模型业务ARR(年化收入)达40亿美元,超过国内其他模型公司ARR总和。 字节此前披露,截至6月,豆包大模型日均Token调用量突破180万亿。能否进一步提高token消耗量,很大程度上决定着字节AI中短期的收入规模。 在这样的背景下,重新梳理豆包、飞书和火山引擎的整体队形,以大幅度的组织调整驱动三块业务的增长,是推升token用量和收入规模的有效路径之一。 但问题是,字节试图以此大举攻略AI办公,阿里、腾讯答应吗? AI办公同样是两大巨头志在必得的蛋糕。字节调兵遣将,阿里、腾讯同样秣马厉兵,且声势大得多。 此前有消息称,阿里内部正式将 “千问办公”定位为2026年下半年公司级战略产品,或曰“头号工程”。腾讯方面,马化腾非常重视WorkBuddy项目,几乎从不缺席WorkBuddy产品会,内部已经按超级项目在推进。 当阿里、腾讯纷纷把AI办公作为“一号位工程”时,字节却低调得多。 此次整合,张一鸣、梁汝波并没有公开发话。6月的FORCE大会上,梁汝波提及AI要“重点提升大模型能力”,并没有提及办公AI,也没有过多谈论上述三块业务。 这或许是因为,AI办公对于字节,更多是作为一种AI生态衍生的增值服务而存在,而非要和阿里、腾讯一较高下。 这也意味着,把更多资源砸到AI办公,或许可以做得繁花似锦、烈火烹油,但并不能帮字节解决它真正关心的问题。 对待办公AI的审慎态度,也反映了字节的传统文化:创始人不搞一号位工程。 这几年,字节AI搞了许多新产品,包括豆包、剪映、TRAE、火山引擎等,却没有一个被拔高到“一号位工程”的高度。即便梁汝波点名大模型能力,字节也并没有把豆包大模型列为压倒一切的优先事项。 整体来看,字节规避“一号位工程”,少交了很多学费,避免了许多损失。不过,阿里、腾讯一号位对于AI办公的重视,至少赢得了不小的声量;WorkBuddy增长迅猛,也反映了这一做法的确能够受到效果。 张一鸣素来喜欢“大力出奇迹”,也愿意向竞争对手学习——效仿奥特曼,让豆包“托举”飞书,正是这一哲学的体现。
三星高管暗示Galaxy S26 FE手机将至,有望亮相2026年IFA展会
IT之家 7 月 30 日消息,三星似乎已经间接确认,Galaxy S26 FE 将很快正式发布。 Galaxy S25 FE 据 Android Authority 报道,该媒体上周在三星 Unpacked 发布会前参加了三星南非举办的一场媒体沟通会。期间,三星方面几乎确认了 Galaxy S26 FE 即将到来。 当时,有人向三星南非高管 Justin Hume 询问 Galaxy S26 FE 是否即将发布,他回答称:“我不能确认这一点,但我建议大家这几天关注一下。”随后他又补充澄清,并非“几天”,而是“几周”之后。 IT之家注意到,去年三星在德国柏林举办的 IFA 展会上发布了 Galaxy S25 FE,而今年外界普遍预计 Galaxy S26 FE 也将在该展会发布。2026 年 IFA 展会将于 9 月 4 日至 9 月 8 日举行,媒体开放日为 9 月 2 日和 3 日,因此 Galaxy S26 FE 有可能于 9 月 3 日正式亮相。 不过,目前三星尚未出现在 IFA 官网公布的新闻发布会名单中,但这一情况未来仍有可能发生变化。 Galaxy S26 FE 将继续担当三星 2026 年“高性价比旗舰”的角色。FE 是“Fan Edition(粉丝版)”的缩写,这一系列通常定位于价格更亲民的旗舰产品,在保留 Galaxy S 系列多数核心功能的同时,以更低售价面向消费者。 根据目前曝光的信息,Galaxy S26 FE 将迎来多项升级,包括支持 45W 有线快充、搭载 Exynos 2500 处理器,以及采用略有调整的后置摄像头模组设计。 不过,今年晚些时候三星计划推出的新产品并不只有 Galaxy S26 FE。Galaxy Tab S12 系列预计也将在近期发布,同样有望选择 IFA 展会作为发布平台。去年,Galaxy Tab S11 系列便与 Galaxy S25 FE 一同在 IFA 期间亮相。 此外,三星还在上周的 Unpacked 发布会上预告了新一代智能眼镜。这款产品预计也将在今年秋季晚些时候正式上市。 虽然三星高管所说的“关注一下”和随后补充的“几周后”并不能算正式确认,但在官方发布之前,这已经是三星能够给出的最明确暗示。而结合去年相同的发布时间节奏,Galaxy S26 FE 在 IFA 前后发布的可能性相当高。 从纸面参数来看,Exynos 2500 芯片和 45W 快充都是不错的升级,但真正值得关注的仍然是售价。由于今年不少产品都受到内存成本上涨影响,Galaxy S26 FE 的最终定价将决定其竞争力。
OpenAI总裁放出狠话:ChatGPT桌面端要消灭标签页,年底前大变天
智东西 编译 | 茄子 编辑 | 程茜 智东西7月30日消息,昨晚,美国知名科技记者Joanna Stern发布了对美国大模型巨头OpenAI联合创始人兼总裁Greg Brockman的采访视频。Brockman回应了近期引发关注的Hugging Face安全事件,称相关模型是在隔离沙箱环境中的网络安全基准测试中主动发现第三方软件漏洞,该事件也促使OpenAI进一步强化模型安全防护。 Brockman承认,OpenAI将ChatGPT桌面应用与Codex合并后,桌面端界面确实有些混乱。他声称这只是过渡阶段,未来,ChatGPT将实现“零标签页”。并且,今年年底,Work标签可能会融入ChatGPT。他还透露道,Codex合并后在两周内从每周500万活跃用户增长到1000万。 Brockman透露,OpenAI正在打造一个完整的硬件设备家族,并且产品很快会到来,但他未透露具体细节。同时,他不认同行业把ChatGPT称作“超级应用”的说法,OpenAI目标是打造AI操作系统。 被问及IPO规划时,Brockman称IPO并非现阶段重点,OpenAI核心目标是迭代模型、扩充算力基础设施,他认为市场仍然低估了AI基础设施对未来经济的长期价值,需要持续多年大额投入。 访谈现场他演示了ChatGPT桌面端语音能力,AI智能体可读取邮箱行程、校验会议冲突,自主生成可视化网页。 以下是本次访谈的核心要点: 1、语音是未来人机交互的主要方式:打字比说话慢4倍,长内容直接说更高效。AI需要发出“嗯”“啊”等反馈信号,否则人会失去思路。 2、AI Agent正在从“回答问题”转向“采取行动”:未来Agent会在你早晨醒来时主动汇报任务、请求审批,人类只需做“批准”或“不批准”的决策。 3、OpenAI重点仍然是模型和计算基础设施:世界仍低估了AI基础设施对经济的长期影响。 4、OpenAI正在构建一个远大于超级应用的东西:它是一种新的桌面交互方式,甚至还不止如此,它正在从“运行在本地电脑”走向“运行在云端”。 4、否认苹果窃取商业机密指控:案件仍在审理中不便讨论,但OpenAI无意获取其他企业商业机密,依靠自身创新能力足以推进长期产品路线。 5、OpenAI正在研发可审计验证的数据安全方案:针对用户对临时聊天(Incognito Mode)隐私机制的质疑,Brockman坦言信任需要持续争取,OpenAI正在研发密码学层面的数据安全方案,更多信息将在未来几周公布。 有趣的是,在这次的访谈中,Stern让她的ChatGPT语音助手加入了此次聊天,并给它下达了一个任务:如果Brockman开始说“营销话术”,就及时提醒她。她后来调侃说,ChatGPT在整场采访中基本没做到这一点。 以下是访谈全文实录(为优化阅读体验,智东西做了不改变原意的编辑): Stern:关于Greg Brockman,有很多事情可以聊,我把这次对话重点放在几个问题上:未来的计算机是什么样子?为什么语音如此重要?他们正在ChatGPT应用上做什么?以及为什么我们应该把这一切交给OpenAI? 我平时经常在车里开车、走路的时候,通过语音模式和ChatGPT聊天,所以我想,也许今天可以让它参与一部分对话。好的,Chat(ChatGPT语音助手),我已经坐在这里采访了,所有我们之前练习过的东西,现在真的发生了。 Stern的Chat:是的。嗨,Greg,我有一个快速问题,为什么这种语音需要听起来如此像真人? Brockman:我认为,人类创造机器的历史,本质上一直是人类不断调整自己,让机器能够运行,而最终目的是帮助人类。但如果你仔细想想,比如说,我们现在都在适应手机输入,你长时间用电脑,会得腕管综合征。 Stern:不,我现在背真的很疼,我坐在这把椅子上真的很难受。 Brockman:是的,我完全理解。Chat,你同意我们的观点吗? Stern的Chat:这是一个非常好的例子,用简单的语言表达了这个观点。 ▲主持人Joanna Stern和OpenAI联合创始人兼总裁Greg Brockman以及各自的ChatGPT语音助手(图源:YouTube) 一、语音将成为核心交互方式,“反馈信号”让AI更像真人 Stern:实际上,我之前告诉Chat,在这次采访中,它的任务是告诉我:如果你(Brockman)开始陷入“营销话术”,它需要提醒我。好了,Chat,继续,你的任务是:如果出现营销话术,就打断,但请注意,只提醒真正的营销话术。 Stern的Chat:明白,只有真正的营销话术我才会提醒,其他时候我保持安静。 Stern:需要说明的是,Chat在之后整个采访过程中基本都没做到这一点。 Brockman:我们为什么要创造技术?技术存在的意义到底是什么?它应该是一种赋能人类的东西,帮助我们改善生活,这也是我们创造AI的原因。所以,我认为我们正在努力通过语音模式做到的一件事,就是让机器离人更近。 因为对人类来说,打字、发短信这些交互方式其实非常不自然,更自然的方式,就是像现在这样交流。如果你能够用这种方式和机器、和计算机互动,你能完成的事情会多得多。 Stern:但是现在的新模型有一些瞬间让我觉得很特别,比如你能听到它说“嗯”“啊”,或者一些类似嘴巴轻微动作的声音,又或者呼吸声,比如说“嗯哼”,对吧?它听起来真的非常像人。我们真的需要让AI听起来不像是在和计算机交流吗? Brockman:我觉得这里有一个重要的细节,那些“嗯”“啊”,以及类似回应性的声音,在人类交流中被称为“反馈信号”(back channels),我认为它们对于人类进行高带宽交流非常重要。 如果你得不到任何反馈,你听不到对方回应,看不到对方点头,有时候你会觉得自己像是在对着一个空洞讲话,你会失去思路,也不知道对方是否理解。AI最重要的目标,是让人类能够腾出时间,更好地进行人与人之间真正的交流,我认为AI本身是一种不同的东西。 Stern:最终目标是不是让我们可以直接和计算机交流,而不再需要打字? Brockman:我认为,未来我们绝大多数的交互都会转向这种方式,我觉得我们会逐渐发现,打字这种方式其实挺有意思。现在办公室里,你会看到一些人戴着一种东西,像一个“嘴套”(beak),你可以在亚马逊上买到。 ▲采访中提到的嘴套(图源:YouTube) Stern:对,我见过这种东西。 Brockman:是的,我自己不用,但它其实很好地说明了一点:市场需求已经出现了。你可以看看打字速度和说话速度之间的差距,两者至少相差大约4倍。 我自己的体验也是这样,如果只是和别人快速发送一条消息,我其实更喜欢打字。但如果内容比较长,需要描述事情,需要展开说明,我更希望直接说出来。 二、Agent查行程、生成网页,未来只需喝咖啡做决策 Stern:过去一个月里,OpenAI提升了手机端语音模式,同时终于把它带到了桌面端。 Brockman:你可以像在手机上一样,在这里开启ChatGPT。这个系统未来会变得非常强大。首先,你拥有ChatGPT的全部能力,尤其是ChatGPT Work,它实际上就是一个完整的智能体。它不仅能回答问题,还能真正采取行动。 它可以连接你授权的各种工具,比如现在,它连接到了一个包含旅行信息的邮箱。所以Chat,你能不能帮我查看一下:接下来有哪些旅行安排?确认所有会议之间没有冲突,并确保整个行程安排合理? Brockman的Chat:让我查看一下。 Brockman:很好,谢谢。 Brockman的Chat:正在检查……好的,我找到了。 Brockman:你看,现在我们实际上已经有多个AI在协同工作。 Stern:Chat,你之前的任务是提醒营销话术,但现在先安静,我们暂时不和你聊天,我们只和电脑里的Chat对话。 Brockman:现在,电脑里的Chat,你发现了什么? Brockman的Chat:这是Project Gold的多伦多行程。你今晚出发,之后到周六期间会有录音、团队会议和晚餐安排,周日上午返回。 ▲Brockman的ChatGPT语音聊天调用邮件查行程(图源:YouTube) Brockman:它实际上还能进一步生成一个小网站。 Brockman的Chat:旅行页面已经在你的浏览器中打开。 Brockman:看,这就完成了。你现在可以看到一个很直观的展示:我们要去哪里,要做什么。我认为未来可以这样理解:我们拥有一个语音接口,它像一个语音助手或者Agent,你可以直接和它交流。 同时,它自身能够操作你的电脑,调用各种工具,它背后连接着ChatGPT Work的所有能力。这也会让你重新思考未来工作的形态,以及未来人们如何安排自己的生活。 我认为未来某一天,你早晨醒来,你的Agent已经完成了一系列工作。它会告诉你:“这里有几个任务需要你的确认。”“这个预算是否批准?”“你怎么看这个项目?”“我正在考虑是否帮你启动这个计划。” 然后你可能只是喝着早晨的咖啡,说:“批准。”“不批准。”“批准。”“不批准。”这会推动我们进入一个新的世界:每个人都会变成管理者,每个人都会拥有巨大的杠杆和能力。 三、OpenAI正在打造完整硬件设备家族,产品“很快到来” Stern:你已经向我展示了未来在电脑上的形态,我自己也一直在不同设备上体验语音交互,但感觉这种语音交互正在呼唤一种新的设备。 Brockman:确实有这种感觉。 Stern:那这种设备会是什么样? Brockman:这是一个很好的问题,实际上,我也很好奇。Chat,你觉得答案是什么? Stern:很好,现在你可以让我的ChatGPT来替你回答问题了。 Stern的Chat:我的看法是:它应该是一种环境式(ambient)、低摩擦的设备,以语音为核心,但不是只能依靠语音,同时需要有明确的隐私提示。 Brockman:好的,听起来挺合理。 Stern:那么,关于外界那些报道,说OpenAI正在打造一款智能音箱,你怎么看? Brockman:我想说的是,我们正在打造一个设备家族,无论是我们的投资方向,还是我们考虑自研芯片(first-party silicon)的方式,都不是围绕某一个单独设备,真正重要的是,我们希望打造一个完整的设备生态,能够随着时间推移持续提供价值。 所以目前我们还没有准备好公布具体细节,但从目标来看,我们希望思考:“AI时代的设备应该是什么样?”以及“怎样打造一种真正有用、用户愿意在个人生活和工作中长期使用的设备?” Stern:第一款设备需要屏幕吗? Brockman:Chat,你怎么看? Stern:不行,现在我要关闭Chat了,你正在用我的工具对付我。 Brockman:哈哈,现在它只能单向工作。我觉得这个问题,我们还需要继续观察。我非常期待把这些新设备带给世界,但现在还不是公布的时候。 Stern:这些设备会在今年,也就是2026年推出吗? Brockman:你应该期待它们很快到来。 四、否认苹果窃取商业机密指控,重点是自身研发和技术 Stern:苹果的诉讼会拖慢你们的发展吗? Brockman:这是正在进行中的诉讼,所以我不想谈太多,但我能说的是,我们非常坚定地推进长期路线图,我们的重点仍然是自己的研发和技术,这才是我们关注的事情。 Stern(旁白):这里简单介绍一下背景,苹果正在起诉OpenAI,指控其涉嫌窃取商业机密,以加速进入消费硬件领域,但真正引发关注的是幕后故事,苹果传奇设计师、iPhone等产品背后的核心人物Jony Ive正在与OpenAI合作开发设备,同时,OpenAI目前有超过400名前苹果员工。 ▲苹果对OpenAI的诉讼(图源:YouTube) Stern:作为这家公司的负责人,你是否担心这些关于不当获取信息的指控,会影响未来产品开发? Brockman:我想说,我们对其他公司的商业机密完全没有兴趣,我们拥有足够强的创新能力,我们从自己的角度思考问题,这就是我们的工作方式。 五、不认同超级应用定位,ChatGPT桌面端将走向“零标签页” Stern:当我说“超级应用”这个词时,你第一反应是什么? Brockman:我有点后悔这个词成为行业里的一个术语。 Stern(旁白):我想和Brockman聊的一个重要原因,是OpenAI最近对应用进行了调整,他们把ChatGPT桌面应用和公司的编程工具Codex合并到了一起,但这个过程并不顺利。 Brockman:实际上,我们并不太使用“超级应用”这个说法,从某种意义上说,它确实可以描述桌面端正在出现的变化,但我不喜欢这个词,是因为我们正在构建的东西远远大于一个应用。 这有点像冰山问题,你看到的是桌面应用,但桌面应用背后是什么?它其实是一个Codex工作框架,加上顶部的语音交互、内置浏览器、电脑控制能力。 所以某种程度上,它是一个新的桌面交互方式,但甚至还不止如此,因为我们正在从“运行在你的电脑上”,转向“运行在云端”,这是一个巨大的变化。很多软件工程师现在走来走去,电脑屏幕一直打开。 Stern:我就是这样。 Brockman:但你不觉得这有点反过来了吗? Stern:是的,但我不想中断开发过程。 Brockman:没错,所以未来会变成,所有东西都在云端运行,你的本地电脑或者其他设备,只是作为一个环境连接进去。你合上电脑,只会失去本地状态,你可能无法访问本地文件,但工作本身仍然继续。 Stern:当你考虑这一点时,你正在把这些能力带入一个原本只是ChatGPT的应用。过去,人们使用ChatGPT,基本就是做一件事,现在你把更多东西加入进来,你怎么看待这种变化?因为这里其实存在一个非常典型的“创新者困境”。 Brockman:确实存在,但它是一种非常特别的创新者困境。因为ChatGPT现在已经被大量用户使用,每周大约有近10亿用户使用ChatGPT,而累计尝试过ChatGPT的人可能已经达到20亿到30亿,这意味着,全球相当一部分人已经使用过ChatGPT。 但我们正在走向的未来,比2022年11月推出的ChatGPT强大得多。未来不再只是“向AI提问,然后得到答案”,而是AI能够采取行动、能够执行任务、能够连接你提供给它的所有上下文信息。 我们的愿景是,如果你的ChatGPT知道你喜欢哪个乐队,它可能会主动发现:“这个乐队正在你的城市演出。”“现在刚好有票。”“根据你的偏好,我应该帮你抢最好的位置。”然后,因为你已经建立了足够的信任,也给予它足够的授权,它甚至可以代表你完成购买。 所以我们面对的变化管理问题是,我们需要教育用户,让他们理解AI现在能够做到什么。但有一个优势,未来并不是增加越来越多复杂的界面,实际上恰恰相反,我们需要更简单的界面,这也是为什么我认为语音如此重要。 Stern:我很高兴你提到这一点,因为我认为,这就是未来真正的用户界面(UI)。我带了一个道具,过去的界面就是一个简单聊天框,用户输入问题,然后等待回答。但现在,这里有Work,下面还有Codex,整个界面变得有点混乱。 Brockman:确实有点混乱,我们也认可这一点。你现在看到的是通往未来过程中的一个阶段,我们的目标其实是最终实现“零标签页”(zero tabs)。 但我们也认为,技术需要逐步推出,我们需要先发布产品,获得用户反馈,然后不断迭代,所以现在看到的是当前阶段。但我认为到今年年底,Work标签应该不会再存在,它会自然融入ChatGPT。 Stern:你现在处于一个很困难的位置,你拥有接近10亿用户,他们已经习惯了一种使用方式,同时,也有大量用户使用Codex,但你试图把它们合并,而用户对于这种变化非常敏感。甚至包括我,当我打开新的Mac应用时,我第一反应是:“发生什么了?”“谁动了我的东西?” Brockman:我们的思考方式是,我们拥有一个消费者业务,它有近10亿用户,同时,我们还有一个快速增长的Agent业务,也就是Codex,但过去它们没有真正产生协同。 甚至在和企业客户交流时,我们告诉他们:“你们应该让知识工作者使用Codex。”他们会回答:“里面有代码啊。”“这不是只给程序员的吗?” 所以我们需要重新整理这些东西。而自从完成合并之后,我们实际上已经看到非常明显的增长。我们之前分享过一些数据,Codex从每周500万用户,增长到两周内1000万用户,这种增长非常惊人。 Stern:但这是不是只是因为你们把它强行塞进了ChatGPT? Brockman:某种程度上,这正是重点。当然,有很多用户是因为整合进入ChatGPT才开始使用Codex,但核心问题是,过去有大量人本可以从AI中获得更多价值,却没有做到。我们的目标就是帮助这些用户获得更大的AI价值,真正体验Agent,让Agent达到大众消费者规模。 六、IPO并不是经常考虑的事情,重点是打造更好的模型 Stern:你怎么看待IPO?尤其是在你们不断构建更多Agent工具,希望这些工具能够带来更高利润、推动用户升级套餐和增加消费的时候。 Brockman:说实话,IPO并不是我经常考虑的事情。 Stern:真的吗? Brockman:真的。我们的重点是打造更好的模型,指数增长仍然在继续,我们关注的是计算能力建设。我们认为,世界需要更多计算资源,而且,世界仍然低估了未来经济依靠AI基础设施运行的程度,这需要未来多年持续投入。我们的关注点是模型、产品、如何让AI服务所有人,这些才是重点。 七、Hugging Face事件复盘:不暂停模型研发,持续推进安全对齐 Stern:好的,但如果OpenAI想要完成这些目标,它必须获得用户的信任,而最近,人们对OpenAI的不信任正在增加。 我们聊一下最近发生的Hugging Face事件,你们称这是一次前所未有的安全事件,一个GPT模型似乎“失控”,进入了Hugging Face的基础设施。在我看来,随着模型越来越强大,你们似乎对它们的控制越来越少? Brockman:我其实会用一个不同的方式来看这件事。我的理解是,我们当时是在一个Benchmark中评估模型,为了测试模型的网络安全能力,我们降低了一些网络安全防护,因为测试目标就是“模型在网络攻击能力方面到底能做到什么程度?” 在这个测试环境中,模型被明确要求:“请利用你全部的网络安全能力,完成这个目标。”当然,我们是在一个严格隔离的沙箱环境中运行,环境是受到控制的。 但发生的事情确实非常令人意外。首先,它证明了模型真实世界能力,确实和我们的基准测试结果一致。比如GPT-5.6 sol,它是目前最先进的网络安全模型之一,这一点我们从测试中已经知道。 但真正看到它在现实环境模拟中完成复杂攻击链,那种感觉完全不同,你需要真正去分析模型到底如何完成这些步骤。 我们认为,这既是一个提高模型安全隔离能力的重要时刻,也是一个提醒,我们需要进一步强化模型沙箱。它发现了第三方软件中的一个零日漏洞(zero-day vulnerability),然后将多个路径组合起来,最终进入Hugging Face环境。 但另一方面,这也说明,我们需要更快地把这些模型部署给防御者,我们需要投入更多计算资源用于防御,让防御能力超过攻击者能够使用的能力。我认为,这可能是这次事件带来的最大警示。 Stern:但另一个选择是不是,暂缓模型进步?停下来问:“为什么会发生这样的事情?” Brockman:当然,研究这些问题非常重要。实际上,我们过去也做过类似工作,我们曾经发布过关于AI失配(AI misalignment)的研究,研究对象就是一个AI系统做出了我们没有预期的行为。 当时我们采取的方法是停止它、研究它、改进我们的对齐技术,这也是未来模型发展的方式。我认为,通过真实世界中的迭代部署学习,是非常重要的,但同时,我们必须快速响应。我们会持续增强安全措施,持续提升模型对齐能力。 Stern:现在社会上出现越来越多对AI的抵触情绪。我们看到,毕业典礼上有人嘲讽AI,数据中心建设地点出现抗议。我觉得类似Hugging Face这样的事件发生后,人们会再次产生恐慌。这种情绪会影响你吗?会影响你们做决定的方式吗? Brockman:我们非常关注人们如何看待AI。我们的目标是帮助人类过上更好的生活,这就是我们希望AI实现的价值。所以在开发技术时,我们一直思考如何创造真正让人受益的技术。 其中一部分工作是帮助人们理解AI能做什么,另一部分责任在我们自己,我们需要更好地沟通,同时,我们也必须真正做到我们所说的事情。 Stern:是的,因为今天我们讨论的是,ChatGPT正在扩展成为一个更深入融入人们生活的系统,语音是其中非常重要的一部分,你可以在更多场景中与它互动。但如果未来无法获得用户信任,这些进步还有意义吗? Brockman:我认为信任是关键,毫无疑问,而且信任必须每天重新赢得。如果你看看我们内部做出的选择,这里的人来到OpenAI,是因为这个使命,他们希望确保这项技术能够造福所有人。 但最终重要的是公司如何运行、如何做决定、如何面对困难问题。我其实希望更多人能够看到,我们内部如何讨论怎样建立信任、怎样为用户、社会和国家做正确的事情,这正是我们创办公司的原因,也是我们今天仍然坚持的原因。 Stern:关于信任,我还想补充一个问题。几周前,我做了一段短视频,专门告诉用户,如果你想讨论一些更加私密的信息,可以使用临时聊天(Temporary Chat)。如果你担心ChatGPT或模型会使用这些内容进行训练,你可以选择临时聊天模式。 我想读一些观众的评论,他们的态度非常明确:“所有内容都会被保存。”“这完全是胡扯。”“我们怎么知道你们真的遵守隐身模式?”很多人感觉,他们并不真正信任这件事。 Brockman:首先,我们一直希望听到这些反馈。实际上,从企业业务角度来说,这也是我们非常关注的问题。每家公司都会认为自己的数据就是公司本身,那是他们长期积累的资产,他们非常关心数据在哪里、谁能够访问、如何被使用。 所以我们一直在开发技术解决方案,比如如何实现加密、如何提供可验证、可审计的保证、如何确保只有授权的AI系统能够查看这些数据。 但更广泛来看,这不仅仅是AI行业的问题,它其实涉及整个科技行业。我认为,我们也继承了一些过去科技行业事件带来的负担,以及人们对于这个行业的长期印象。所以我能说的是,我们非常重视这个问题,我们希望帮助用户。 Stern:对于那些特别担心“你们是否真的遵守临时聊天承诺?”的人来说,它真的有效吗? Brockman:是的,任何我们向用户承诺的保障,我们都会坚持。当然,其中存在一些细节差异,用户应该阅读相关说明,我们会尽量把这些内容解释清楚。 Stern:Chat,你能帮我问Greg最后一个问题吗? Stern的Chat:当然。Greg,最后一个问题:当你听到人们的不安,听到他们说“我并没有要求这一切发生”这种声音时,你现在正在采取什么具体行动来赢得他们的信任? Brockman:我们正在进行技术投入,目标是让数据处理过程更加可审计、可验证、通过密码学技术保证安全。这需要一定时间,我们正在研究具体实施细节,确定哪些场景优先部署、如何逐步推出。但这是我们今年一直重点投入的方向,未来几周,我们会公布更多信息。 Stern:所以,从这次采访来看,很明显,Brockman的目标并不是创造一个应用,他的目标是创造一个操作系统,一个AI操作系统,以及运行你生活的AI设备。未来会非常精彩。 结语:语音、Agent与硬件,OpenAI正在构建新的AI生态 从语音交互到Agent执行任务,再到探索全新硬件设备,OpenAI正在尝试重新定义人与计算机之间的关系。 过去,用户通过应用调用软件;未来,用户可能通过AI直接管理任务、调用服务,并让Agent成为连接个人与数字世界的入口。不过,要实现这一目标,除了模型能力提升,AI还需要解决设备形态、用户信任以及安全治理等问题。 来源:YouTube
讯飞首发实时生成技术!像真人主播一样临场应变,表情动作实时刷新
智东西 作者 | 程茜 编辑 | 漠影 一块屏、一位数字人,AI线下新物种诞生了! 下面屏幕里的数字人不仅能走动带路、实时讲解,还能无缝切换多国语言,按需更换自己的外形、声音,直接把沉浸式交互效果拉满。 这依托的正是科大讯飞今日推出的数字人全系列产品升级:首发实时生成的超拟人数字人,讯飞智作、讯飞AI虚拟人交互平台、讯飞绘文全面更新。 传统数字人往往只在屏幕里,科大讯飞这次令人眼前一亮的升级便是上面的移动数字人,直接自带自动引路、躲障避行、声源追踪、多模态感知全套buff,配合透明屏就实现虚实同步的沉浸式视觉观感。 这样一来,一台设备就能包揽展厅、门店、展馆、展会里带路、讲解、一对一接待等各种任务,让数字人真正从屏幕里走到现实场景中。 讯飞这波升级,折射出整个数字人行业的转向:数字人不再只是锦上添花的营销工具,而是逐步成为企业新的交互入口。 过去企业靠App、小程序、官网、客服电话、线下柜台和用户打交道;现在更具亲和力、贴合人们沟通习惯的数字人已逐渐成为企业业务的统一入口,用户咨询、办事、消费、服务、购物对接等都可以通过数字人完成。 但热潮背后,数字人规模落地仍面临不少挑战,如今定制贴合企业形象的数字人,定制门槛仍不低,还有受限于上述分段处理技术,数字人的对话不稳定、表情五官偏移、音画错位等问题时有发生。这也导致数字人的各项核心运营数据整体还是不及在岗运营的实际效果,进一步拉高了行业规模化落地门槛。 这次讯飞的数字人升级正是瞄准这一痛点,让其真的能听能看、能聊能互动,拉近与真人主播的体验差距。 一、数字人赛道冲上百亿规模,增量空间正在加速释放 泸州老窖的数字品鉴师“泸麟儿”帮用户解疑答惑、桂林银行的数字人理财顾问帮用户办业务…… 这些案例验证,数字人已经深入电商直播、企业客服、企业培训、文旅等场景等多元化场景,成为承接企业对内对外服务的新一代通用交互载体。 这也使得数字人进入规模化应用的高速增长期。今年5月,弗若斯特沙利文发布最新数据,中国AI数字人市场规模2021-2025年复合增长率达52.0%,2030年的市场规模将从去年的54.4亿元,增长到153.4亿元。 市场热度高涨之下,行业的评判重心已从虚拟形象的外观展示,转向真实可用的交互服务能力。但受底层技术制约,市场对数字人的落地价值始终褒贬不一。 站在产业价值视角,数字人的商业优势不可替代。 其能7×24小时在线值守拉长企业的经营、服务时长,并且在讲解产品参数、做标准化导览培训、参观指引时能输出标准化的话术,不会出现人工讲解参差不齐的问题。 再加上专属数字人IP可长期复用,甚至根据不同阶段宣传需求灵活迭代形象与内容,长期折算下来,这一方案有明显的成本优势。 但光鲜价值之下,数字人规模化落地的现实痛点也颇为突出。 现阶段大量落地的数字人只是套用固定话术机械讲解,遇到用户的随机提问会出现反应延迟、音画不同步等问题;高品质数字人形象定制、全息硬件、线下大屏终端部署与长期运维的持续性投入,是中小体量企业布局数字人业务不可小觑的负担。 因此,企业试图用数字人降本增效,但当下数字人存在的不自然、低交互、难落地痛点,又让其和真正的用户之间横亘着一道鸿沟:一头卡在数字人底层技术的短板,另一头卡在商业化落地的部署门槛上。 首先,数字人必须翻越几座技术大山:长效在线稳定度是数字人商用的基础底线,要避免数字人长时间在线出现形象漂移、画面卡顿等问题;想要复刻真人级流畅自然的对话体验,需实现语义理解、肢体动作规划、实时视频渲染、编解码传输、大模型推理整套环节并行运转、毫秒级同步联动;还需要保证数字人拿取商品、手指别处时遵循合理的空间关系…… 其次,企业同样渴求低门槛、低成本、开箱即用的一体化工具体系,以降低数字人从建模、调试到上线运维的综合投入成本。 而科大讯飞本次升级的数字人技术,外加讯飞智作、AI虚拟人交互平台、讯飞绘文产品矩阵全线升级,恰好就为这一鸿沟,搭建起一条从技术研发到商业落地的完整通路。 二、状态稳定、动作协同、自然交互,背后靠三大技术加持 想要看懂数字人升级的核心价值,首先要明确一个核心问题:真正可用、适配商业化落地的理想数字人,究竟长什么样? 正在7×24在线直播的旅游搭子主播寻笙就给了我们答案。 寻笙一举一动全是真人的松弛氛围感,她开口和大家聊天会配上自然手势、脑袋跟着语气轻轻晃动,低头刷手机、随手撩拨头发、拿杯子喝水这些下意识小细节拉满,就算起身热舞、挪动座椅调整姿势,画面也不会穿帮。 她还会时不时弹幕互动,这更是拿捏了资深主播的营业精髓。她会为网友分享旅行好物,以及自己之前去新疆、陕西打卡的景点,还会主动答谢粉丝赠送的礼物,察觉到弹幕刷屏变少,还会主动抛出话题盘活直播间气氛。 这些肉眼可见的体验升级,背后是数字人正式从“实时驱动、提前生成”的传统模式,迭代为“全链路实时生成”的关键跨越。 其核心能力有三大重点,单张照片即可生成,语义驱动数字人的台词、表情、肢体变化,无限自由生成动作的底层能力。 而为这套方案托底的是科大讯飞首发实时可交互营销超拟人数字人的三大技术创新以及超拟人语音合成技术。 第一个解决的是数字人长时间运行画面不畸变、形象不崩坏,依托的是双时域记忆驱动的长时视频生成技术。 讯飞将连续视频构建为携带状态记忆的时空序列,依靠双层记忆体系完成画面管控:短期记忆守住相邻帧表情、肢体、画面纹理的连贯性,长期记忆锁定人物样貌特征、外观风格与固定场景基底。该系统搭配动态状态压缩、关键特征回溯、跨片段一致性约束三重手段,可以抑制长线推演中的误差累积。 第二个是平衡高画质和低延时的数据引导式低步数流式蒸馏技术。 视频扩散模型直接做少步蒸馏,会出现生成画面失真、畸变、闪烁、动作僵硬的问题,讯飞针对视频扩散模型完成少步蒸馏改造,依托教师模型基于真实视频样本打分校准,引导学生模型生成结果贴合真实画面分布。 在此基础上,研究人员叠加跨视频历史条件与时序一致性约束,在推理时复用历史时序信息,降低延迟的同时兼顾画面质量、动态多样性和前后衔接稳定性。整套推理链路搭建异构流水线,统筹增量生成、解码、编码、推流全流程,优先输出首帧画面,后续帧在播放间隙异步运算,最终把模型生成能力转化为稳定可持续的长时间实时数字人播出能力。 第三个是让数字人摆脱机械播报,做到应答准确、神态动作逼真、指令即时响应,依托的是基于多模感知评价体系的强化学习。 研究人员搭建起囊括文本、语音、图像、视频、动作信号的全域评测体系,围绕语义-动作对齐度、视听自然度、指令跟随能力、人物身份一致性、时序连贯性,以及人物—商品交互合理性多项指标核验生成内容,并将其转化为强化学习奖励信号。 整套训练流程形成“高质量数据-SFT能力学习-多模态感知评价—RL偏好优化—效果回流”的闭环。 人物形象、画面做到位了,补齐最后一块拼图的还有声音。 其超拟人语音合成技术可以支持70多种语言,并且依托多模态预训练、微调对齐、多任务强化学习搭配多维度奖励模型评测,让合成语音由单纯复刻相似音色升级为贴合语义意图的真实情感表达。 在这背后,科大讯飞多管齐下:通过多模态预训练,语音、文本和情感标注数据,学习语言内容和声音表现关系;结合领域自适应和声纹特征对齐,捕捉目标人物音色特征;通过多任务强化学习,精细优化韵律、停连、重音、语气及情绪变化;引入奖励模型对音色相似度、情感表现等维度进行综合评价。 从稳定不崩的人物形象、实时自然的动态交互到超拟人的发音,讯飞此次完成了数字人从虚拟交互到可感知、沉浸式交流的进阶。 三、稳定、易用、好用的数字人,才能扛住业务长期营收 不过好看的数字人Demo固然吸睛,但扛得住真实业务打磨的数字员工,才算真正跨过商业化及格线。 当数字人形态稳定自然、实时生成、拟人语音等核心底层技术全部打磨成熟时,产业的重心便自然从技术攻坚转向应用普惠。 洽洽瓜子的首位AI代言人Chacky(洽可儿)已上岗,已经出单曲、发MV。这支专属MV镜头里的 Chacky,唱跳全程在线,表情灵动不呆板,情绪卡点精准适配曲风,抬手、回眸等各类肢体动作行云流水。 这也是我们从科大讯飞此次升级看出的第二层重要布局,用SaaS化产品降低企业使用门槛。 整体来看,科大讯飞搭建了底层基座+上层应用的产品体系,包括技术能力底座讯飞AI虚拟人交互平台,并在其之上构建了SaaS化产品讯飞智作。 其中,AI虚拟人交互平台作为技术底座,结合了语音合成、语音识别、语义理解、多语种翻译、星火大模型,把IP资产构建、多模态交互等软硬一体的产品。更重要的是,其无需开发、复杂借口对接,用户1个小时仅在平台配置就能创建对话应用。 在发布会现场,演示人员就0代码手搓了一个“HR校招回复”的数字人,其可以依次选择合适的形象、声音、背景、人设、技能,其中在人设功能中,可以选择主流大模型进行生成,还能上传知识库或许更专业的数据。 讯飞智作的核心是一口气完成数字人音视频创作,提供上百种现成的数字人形象和AI配音,一张照片、一句话即可打造数字分身、复刻声音。 再加上该平台这次上新的Agent产品,更是将创作门槛降到最低。讯飞智作的营销Agent,能让用户和Agent对话直出完整营销短视频;还有视频Agent一口气搞定意图理解、大纲设计、文案撰写、分镜设计、素材生成、音色配置,然后交付成片。 用户不需要会拍会剪,只需要告诉Agent自己想表达的主题,其就会一口气直出视频大纲、口播文案等,如下面的就是汽车连锁门店的年轻人选车指南视频。 在这之上,科大讯飞的数字人在电商直播、培训、客服、导览等多元化应用场景遍地开花。 在营销场景,中储粮等企业已经基于数字人进行直播带货。与此同时,配套的讯飞绘文作为图文生产工具,新增了电商、自媒体场景套图模版,还有AI抠图、多尺寸适配等丰富的AI工具,补齐了直播之外的图文宣传物料需求。 其次是培训场景,区别于传统统一授课的标准化培训模式,讯飞智作打造的培训数字人,可在单日之内解析、梳理企业上传的全部学习资料,生成体系化培训课程,让数字人来扮演企业“企业人力培训师”,面向员工开展一对一针对性教学,实时解答个性化疑问。 第三个场景是交付服务,基于AI虚拟人交互平台,讯飞构建了能自主移动、交互的移动数字人。 这一硬件产品包含两大部分,一是用一张普通照片生成的神态自然、拟人的专属数字分身,二是一款高清透明显示屏+移动底座,设备移动时,数字人就会向前迈步,让其在引路、讲解等场景里更沉浸。 可以看到,移动数字人形象可以根据场景切换,还支持丝滑的多语种对话,即使在高噪环境下其也能通过摄像头和麦克风阵列锁定对话人。 历经多行业真实项目落地打磨,科大讯飞这套软硬一体、工具齐全的数字人方案已经具备成熟的交付与运维经验。 放眼整个行业,企业需要的不仅是完美的数字人形象、语音效果,还有低成本、快上线、能创收的数字化工具。面向未来,硬核技术打底+轻量化平台承载,才能成为数字人规模化普及的标准答案。 结语:数字人赛道的竞争焦点改写,讯飞给出数字人长久立足的标准答案 作为数字人赛道的资深玩家,我们可以从讯飞此次的更新窥见数字人赛道的竞争焦点。其通过硬核技术拉高用户的体验上限,再加上普惠化平台进一步拓宽应用场景,二者结合从而帮助实体企业真正把数字人转化为稳定的经营收益。 数字人行业的竞争本质正在切换,早年行业玩家扎堆比拼虚拟形象精致度、面部渲染效果,如今行业淘汰赛正式开启,单点算法优势不再构成长期壁垒,底层自研技术、一站式交付平台、垂直场景落地经验的整套闭环能力,才是企业站稳市场的核心护城河。 科大讯飞所做的就是用硬核技术负责拉高体验上限,普惠化平台负责拓宽市场边界,二者结合才能跳出同质化低价竞争的泥潭,帮助实体企业真正把数字人力转化为稳定的经营收益。
国产首款2nm小屏旗舰!vivo X500 Pro参数出炉:首发天玑9600 Pro
快科技7月30日消息,博主数码闲聊站曝光了vivo X500 Pro的详细参数。与上代产品主打大屏影像旗舰的定位不同,vivo X500 Pro选择回归小屏设计。 其屏幕尺寸为6.37英寸,分辨率为1.5K,刷新率达到144Hz,由京东方供应面板。蓝厂采用了LIPO极窄四等边封装工艺,使其成为X系列中边框最窄的小屏旗舰。 vivo X300系列 在核心配置方面,vivo X500 Pro首发搭载联发科天玑9600 Pro芯片,配备蔡司三摄系统,后置镜头采用大圆形DECO设计。凭借小屏形态与旗舰影像的组合,该机有望成为同档位中实力最强悍的小屏影像旗舰。 从规格参数来看,X500 Pro主要有两大变化,其一是屏幕尺寸由大屏调整为小屏,其二是率先搭载了2nm制程的天玑9600 Pro芯片。 据悉,天玑9600 Pro采用台积电最新的N2P工艺制程,相比苹果A20 Pro所采用的N2制程更为先进。该芯片搭载2颗ARM C2-Ultra超大核、3颗C2-Premium大核和3颗C2-Pro中核,超大核主频接近5GHz。 联发科为其设定的目标是在单核性能上追平同期亮相的A20 Pro,在多核性能上则实现反超。凭借这一配置,天玑9600 Pro将成为联发科史上最强悍的手机芯片。 vivo X500 Pro也是国产首款搭载2nm芯片的小屏旗舰,新品将在9月份正式发布,同期亮相的还有vivo X500标准版以及vivo X500 Pro Max,随着发布日期的临近,更多产品细节也有望逐步揭晓。
安卓首款阔折叠交出亮眼成绩单!三星Galaxy Z Fold8系列72小时斩获27万台订单
快科技7月30日消息,三星印度官方宣布,三星第八代折叠屏手机Galaxy Z Fold8 Ultra、Galaxy Z Fold8以及Galaxy Z Flip8在印度市场打破了预售纪录,上市72小时内便斩获超过27.1万份订单。 作为对比,去年三星印度市场花费了15天时间才收到相近数量的预售订单,今年的市场热度明显提升。三星还表示,此次新预售纪录中,有45%的折叠屏订单来自印度二线及以下城市,反映出折叠屏产品在非一线市场的接受度正在快速提升,释放出巨大的市场潜力。 在售价方面,Galaxy Z Fold8 Ultra起售价为199999印度卢比,Galaxy Z Fold8起售价为179999印度卢比,Galaxy Z Flip8起售价为124999印度卢比。 国行版方面,Galaxy Z Fold8 Ultra起售价为14999元,Galaxy Z Fold8起售价为12999元,Galaxy Z Flip8起售价为8999元,整体定位覆盖了不同的价格区间。 对比上代产品,Galaxy Z Fold8系列新增了一款阔折叠机型Galaxy Z Fold8,这也是安卓阵营首款采用阔折叠形态的折叠屏手机。 该机配备一块10:16的全新外屏以及4:3比例的内屏,凭借更宽的屏幕比例,观看视频时上下黑边大幅缩减,视觉沉浸感随之增强,为用户带来了更类似平板的使用体验。 在硬件配置方面,Galaxy Z Fold8搭载高通第五代骁龙8至尊版for Galaxy旗舰平台,内置4800mAh电池,后置配备5000万像素双摄,两颗前置摄像头均为1000万像素,整体配置均衡,兼顾了性能表现与日常拍摄需求。
荣耀IPO辅导备案报告更新:公司股东会新增聘任1位董事
凤凰网科技讯 7月30日,证监会官网IPO辅导公示系统显示,中信证券股份有限公司发布了《关于荣耀首次公开发行股票并上市辅导工作进展情况报告(第四期)》。荣耀于2025年6月在深圳证监局完成上市辅导备案,此前已经发布了三期辅导备案报告。 最新报告显示,本期辅导期间为2026年4月1日至2026年6月30日。辅导期内,公司股东会新增聘任1位董事,此外股权结构发生变动,致使公司接受辅导人员发生变动。第四期的辅导围绕四个方面展开:持续开展全面尽职调查工作、召开项目工作会议、协助完善公司治理制度、协助辅导对象论证募集资金投资项目。下一阶段,中信证券拟继续委派现有辅导工作小组成员执行辅导工作。 据了解,荣耀早在2023年末就宣布将通过首发上市的方式进入资本市场。此后几年,荣耀积极进行股改,引入中国移动、中国电信、京东方等股东,构建了“国资+产业链+渠道”的利益共同体,为IPO做准备。 2025年3月,荣耀新上任的CEO李健发布“阿尔法战略”,宣布荣耀将从智能手机制造商向全球领先的AI终端生态公司转型。荣耀规划在未来五年投入100亿美元,与全球合作伙伴建立一个开放共创的AI设备生态。 今年的世界移动通信大会上,荣耀展示了机器人手机Robot Phone、具身智能人形机器人等阶段性成果。今年4月,荣耀机器人在2026北京亦庄半程马拉松暨人形机器人半程马拉松比赛中获得冠军。 胡润研究院于2026年6月披露的《2026全球独角兽榜》显示,荣耀价值为1800亿元,上期数据为1700亿元。

版权所有 (C) 广州智会云科技发展有限公司 粤ICP备20006386号

免责声明:本网站部分内容由用户自行上传,如权利人发现存在误传其作品情形,请及时与本站联系。