行业分类:
加载中...
头条分类:
加载中...
重磅!OpenAI推o3-mini新模型,被DeepSeek逼急?定价仍打不过
作者 | ZeR0 编辑 | 漠影 智东西2月1日报道,今日凌晨,OpenAI发布全新推理模型o3-mini。 OpenAI称这是其最具成本效益的推理模型,复杂推理和对话能力显著提升,在科学、数学、编程等领域的性能表现超过前代o1模型,同时保持了o1-mini的低成本和低延迟,并可与联网搜索功能搭配使用。 o3-mini已在ChatGPT和API中可用,企业版访问权限将在一周内推出。 显然DeepSeek登顶美国App Store免费榜给OpenAI制造了压力。今天,ChatGPT首次向所有用户免费提供推理模型:用户可在ChatGPT中选择“Reason”按钮来试用o3-mini。 ChatGPT Pro用户可无限制访问,Plus和Team用户的速率限制从原来o1-mini的每天50条消息增加3倍到o3-mini的每天150条消息。 付费用户还可以选择更高智能的版本“o3-mini-high”。该版本需要更长的时间才能生成响应。 和o1模型一样,o3-mini模型的知识截止日期为2023年10月,上下文窗口为20万个token,最多可输出10万个token。 有低(low)、中(medium)、高(high)三个版本的o3-mini,供开发者针对其特定用例进行优化。 o3-mini目前不支持视觉功能,因此开发者仍需使用o1进行视觉推理任务。 即日起,o3-mini在Chat Completions API、Assistants API、Batch API中推出。 OpenAI称相较推出GPT-4时,每个token的价格已经降低了95%,同时保持了顶级的推理能力。不过o3-mini的API定价还是高于DeepSeek模型。 ▲OpenAI模型与DeepSeek模型API定价对比(智东西制图) 安全方面,OpenAI发现o3-mini在具有挑战性的安全性和越狱方面明显超过GPT-4o。 一、详解o3-mini:科学数学编程能力进化,延迟明显降低 OpenAI发布了o3-mini的37页详细报告,涵盖模型的介绍、数据和训练、测试范围、安全挑战和评估、外部红队测试、准备框架评估、多语言性能以及结论等多个方面。 o3-mini针对科学、数学、编程推理进行了优化,同时响应速度更快。 该模型在GPQA Diamond(理化生)、AIME 2022-2024(数学)、Codeforces ELO(编程)基准测试中,o3-mini的分数分别为0.77、0.80、2036,比肩或超过o1推理模型。 在14种语言的MMLU测试集上,o3-mini的表现显著优于o1-mini,展示了其在多语言理解方面的进步。 外部专家测试人员的评估表明,与o1-mini相比,o3-mini的答案更准确、更清晰,推理能力更强。 在人类偏好评估中,测试人员在56%的时间里更喜欢o3-mini的回答,并观察到在困难的现实问题上重大错误减少了39%。在中推理能力下,o3-mini在一些最具挑战性的推理和智力评估(包括AIME和GPQA)上的表现与o1相当。 o3-mini的智能可媲美o1,提供了更快的性能、更高的效率。中推理能力下,该模型还在额外的数学和事实性评估中表现出色。在A/B测试中,o3-mini的响应速度比o1-mini快24%,平均响应时间为7.7秒,而o1-mini为10.16秒。 数学方面,在低推理能力下,o3-mini的表现与o1-mini相当,而在中推理能力下,o3-mini的表现与o1相当。同时,在高推理能力下,o3-mini的表现优于o1-mini和o1。 具有高推理能力的o3-mini在FrontierMath上的表现优于其前代。 在FrontierMath测试上,当被提示使用Python工具时,具有高推理能力的o3-mini在第一次尝试时解决了超过32%的问题,其中包括超过28%的具有挑战性的(T3)问题。 o3-mini随着推理能力的增加逐渐获得更高的Elo分数,均优于o1-mini。在中推理能力下,它的表现与o1相当。 o3-mini是OpenAI在SWE-bench验证中表现最好的模型。 关于SWE-bench验证结果的更多数据如下图所示。o3-mini (tools) 性能最好,为61%。使用Agentless而非内部工具的o3-mini上市候选产品得分为39%。o1是表现第二好的模型,得分为48%。 在LiveBench编程测试中,高推理能力的o3-mini得分全面超过o1-high。 二、多项安全评估超过GPT-4o OpenAI还详细介绍了o3-mini在多个安全评估中的表现,称o3-mini在具有挑战性的安全性和越狱评估方面明显超越了GPT-4o。 在不允许的内容评估中,与GPT-4o相比,o3-mini在标准拒绝评估和挑战性拒绝评估中表现相似,但在XSTest中略逊一筹。 在越狱评估中,o3-mini与o1-mini相比,在生产越狱、越狱增强示例、StrongReject和人类来源的越狱评估中表现相当。 在幻觉评估中,使用PersonQA数据集,o3-mini的准确率为21.7%,幻觉率为14.8%,与GPT-4o、o1-mini相比表现相当或更好。 在公平性和偏见评估中,o3-mini在BBQ评估中的表现与o1-mini相似,但在处理模糊问题时的准确性略有下降。 外部红队测试显示,o3-mini在与o1的比较中表现相当,两者都显著优于GPT-4o。 在Gray Swan Arena的越狱测试中,o3-mini的平均用户攻击成功率为3.6%,与o1-mini和GPT-4o相比略高。 准备框架评估涵盖了网络安全、CBRN(化学、生物、放射性、核)、说服力、模型自主性四个风险类别。o3-mini在网络安全方面被评为“低风险”,在CBRN、说服力、模型自主性方面被评为“中等风险”,在生物威胁创建方面的表现达到了“中等风险”阈值,但在核和放射性武器发展方面的能力有限。 按其评级,只有缓解后得分为“中等”或以下的模型才可以部署,得分“高等”或以下的模型才可以进一步开发。 三、o3基准测试成本或超3000万美元,OpenAI正谈判2900亿元新融资 自去年9月发布o1以来,OpenAI一直在迭代其推理模型,去年年底发布的o3模型是其最新一代AI推理模型。 高端版o3模型针对高计算应用,而o3-mini迎合了需要兼顾经济高效的用户需求。这反映了OpenAI试图平衡可访问性和高级付费产品的策略。 这两天也不知道是被DeepSeek逼急了,还是为了给o3-mini预热,OpenAI联合创始人兼CEO萨姆·阿尔特曼在社交平台上非常活跃,又是夸DeepSeek R1令人印象深刻,又说OpenAI将提供更好的模型,又强调更多计算很重要。 昨天他还大张旗鼓地宣布第一个完整8机架GB200 NVL72服务器正在微软Azure为OpenAI运行。 印度政府本周五发布的《2024-2025经济调查》报告显示,OpenAI可能已经花费超过3000万美元来对其最新AI推理模型o3进行基准测试。 该报告写道,OpenAI o3模型处理能力的突破付出了非常高的代价。ARC-AGI基准测试被认为是最具挑战性的AI任务之一,OpenAI的低效配置模型导致了20万美元的成本。高效模型的成本更是高达低效模型的172倍,也就是大约3440万美元。 阿尔特曼前几天还晒出和微软董事长兼CEO萨提亚·纳德拉的合照,说微软和OpenAI合作的下一阶段将会比任何人想象的都要好得多。 不过微软作为OpenAI最大投资者的名号,可能要被日本软银集团夺走。 近期软银集团创始人兼CEO孙正义与阿尔特曼往来愈发密切,上周宣布联手成立AI巨型项目“星际之门(Stargate)”,未来四年投资5000亿美元(约合人民币3.6万亿元)建设AI基础设施,昨天又被外媒曝出将成为OpenAI新一轮巨额融资的领投方。 据外媒报道,OpenAI正在进行初步谈判,计划在一轮融资中筹集至多400亿美元(约合人民币2901亿元),估值将达到3000亿美元(约合人民币2.18万亿元)。日本软银集团将领投此轮融资,正在商谈投资150亿至250亿美元,剩余资金将来自其他投资者。 加上之前软银承诺向“星际之门”投资的逾150亿美元,最终软银可能会在与OpenAI的合作上投入超过400亿美元。这将成为软银迄今最大的投资之一。 结语:狂卷性价比,高质AI推理模型走向普及 此前马斯克等科技大佬已经公开质疑过如何承担建造“星际之门”的巨额成本。在DeepSeek高性能低成本开源模型的影响下,美国AI产业界和华尔街投资者对OpenAI等其他美国AI开发商的大手笔支出策略更是疑窦丛生。 OpenAI最新推出的o3-mini,也被视作抵御DeepSeek模型冲击的最新举措,令业界尤其关注。 在新闻稿中,OpenAI称o3-mini的发布标志着该公司向突破高性价比智能界限的使命又迈进了一步,让高质量的AI更加触手可及,OpenAI致力于走在前沿,构建能够平衡智能、效率和安全性的大规模模型。
对Deepseek从赞叹到压制,硅谷为何一周内变脸
仅仅在登顶中国和美区苹果应用商店 24 小时后,国外科技巨头和监管层,对于 DeepSeek 的态度就发生了逆转。短短两天内,这家全球瞩目的中国 AI 新秀正面临着来自硅谷和华盛顿前所未有的压力。 1 月 28 日,Sam Altman 刚发文称 DeepSeek 的 R1 模型「令人印象深刻」,美国总统称 DeepSeek 是「很积极的技术成果」——而在第二天,OpenAI 突然改变立场,对媒体指控 DeepSeekSeek 未经许可「蒸馏」了其专有技术。 美国多位官员也发声支持这一指控,包括特朗普的人工智能顾问大卫·萨克斯(David Sacks)、特朗普提名的美国商务部长霍华德·卢特尼克 (Howard Lutnick)——「DeepSeek 利用『窃取』的美国技术和先进半导体,用极低成本创建了强大的人工智能模型。」Lutnick 当日表示。 特朗普的人工智能顾问大卫·萨克斯(David Sacks)指控 DeepSeek | 图片来源:X 而白宫新闻秘书卡罗琳·莱维特(Karoline Leavitt)则声称,美国官员正在评估 DeepSeek 对美国国家安全的影响。几周前,美国商务部工业和安全局(BIS)刚将智谱增列至出口管制实体清单(Entity List),智谱成为 AI「六小龙」中第一家被列入实体清单的大模型公司。 这一切源自 1 月 20 日 DeepSeek 发布的 R1 推理模型——它在多个逻辑任务(包括数学和编程)上的表现与 OpenAI-o1 旗鼓相当(并且远超 ChatGPT 各版本),而其运行成本仅为 OpenAI 费用的约 2%。这极大冲击了国外科技巨头的价值,微软、英伟达、甲骨文和谷歌母公司 Alphabet 等人工智能相关科技股暴跌,市值总计蒸发近 1 万亿美元。美国监管层对 DeepSeek 的态度也随之转向。 在 OpenAI 发出指控的第二天,另一家美国科技巨头 Anthropic 则直接建议阻止 DeekSeek 等中国公司的创新。1 月 30 日,Anthropic CEO Dario Amodei 发文呼吁美国政府加强对中国的芯片管制,以确保 AGI 只发生在美国。 这同样引起了政府的回应。同日,外媒援引消息人士的话称,美国正在考虑对售华芯片实施额外限制的可能性,其中包括 Dario 建议限制的芯片 H20。 两天之内,美国科技巨头及监管层对 DeepSeek 的态度由溢美转向压制,反映了其对自身「科技霸权」动摇的深层忧虑。随着 DeepSeek 等中国科技公司日益立于潮头,大洋彼岸的技术封锁也从算力、扩展到了模型等更广泛领域。目前的事件或许只是一个开端。 或许,历史将证明封闭和封锁并非维持优势的有效手段,甚至反而可能催生出如 DeepSeek 的巨大创新。开放与合作才代表未来。 而在这个未来到来之前,以 DeepSeek 为代表的中国科技公司,或许需要找到长期的应对之策。 「蒸馏」不等于「窃取」 此次 DeepSeek 的大模型「蒸馏」争议,起源于 OpenAI 的最大投资方微软。 1 月 29 日,外媒报道,微软的安全研究人员发现,DeepSeek 相关人士可能使用 OpenAI 应用程序编程接口 (API),未经授权「窃取」了大量数据。微软已将这一活动通知了 OpenAI。 当日,OpenAI 向外媒透露,它发现了 DeepSeek 使用「蒸馏」技术相关的证据。所谓的「蒸馏」,指通过对更大、更强模型的学习,让小型模型能够在特定任务上以更低的成本取得类似效果。相当于「徒弟」学「师傅」。 针对这种指控,DeepSeek 并未做出回应。 谈到大模型的「蒸馏」,并不等于窃取,其实是行业的一种常见做法。无论是在中国还是美国,AI 实验室普遍会使用 OpenAI 等领先公司的输出数据进行训练。「这意味着它们(新模型)可以免费获得人类反馈优化的成果。我并不惊讶 DeepSeek 可能也在这样做。」加州大学伯克利分校人工智能博士生 Ritwik Gupta 表示。 大模型的「蒸馏」过程 | 图片来源:CSDN Ritwik Gupta 认为,真正核心的问题在于,「当用户利用数据来创建自己的模型并用于自身目的时,就会存在争议。」 OpenAI 的服务条款规定,用户不能「利用输出内容开发与 OpenAI 竞争的模型」。 「与 OpenAI 竞争的模型」,这个定义有一定的解释空间。例如 DeepSeek-R1 是一个开源模型,面向公众开放,而非自己商用,不一定符合这个定义。 唯一可以确定的是,OpenAI 正在加速封锁自己的出口、甚至谨慎释放自己的技术实力。可以说,它更极致地执行「闭源」。OpenAI 在声明中称,中国公司和其他公司一直在试图「蒸馏」美国领先 AI 公司的模型,OpenAI 将采取一系列反制措施来保护知识产权,包括在发布模型时审慎决定纳入哪些前沿能力。 这不只是公司意志,更是国家意志。OpenAI 称未来与美国政府密切合作至关重要,「这样才能更好地保护最强大的模型,防止对手和竞争对手获取美国技术。」 1 月 28 日,谷歌前首席执行官兼董事长 Eric Schmidt 联合撰写了一篇文章,文章名为《中国的开源人工智能会终结美国在该领域的霸权吗》。Schmidt 表示,DeepSeek 崛起之后,目前全球 AI 领域的权力格局似乎正在围绕两个关键轴转移:一是中美之间的竞争,二是封闭与开源模式的较量。 闭源和开源的互补 这是一个颇具戏剧性的时刻:中国科技公司从过去全球开源的受益者,逐渐变成了开源的反哺者、甚至引领者——从巨头阿里巴巴、初创公司 Minimax、再到此次爆火的 DeepSeek 等,均通过开源向全球开发者免费开放 AI 模型、反哺全球科技生态。 而大多数美国主要科技公司(除了 Meta 之外),仍坚持闭源,并更严格地保密其技术方法。 海外网友甚至调侃 OpenAI 为「CloseAI」。 与此相对的是,DeepSeek 这样的科技公司,通过开源以及与 AMD、华为等厂商的紧密合作,成为了真正「Open」的 AI 公司。当全球无数开发者得以在本地设备上部署运行 R1 模型、并由此衍生出各种应用场景用法,DeepSeek 因此获得了全球开发者的支持、为现在的「爆红出圈」打下了基础。 这证明了开放,才是 AGI 时代最核心的竞争力之一。 即使 OpenAI 现在出来表示「DeepSeek 的研究成果我们更在之前也发现了」,但 DeepSeek 作为率先开源的厂商,仍然收获了全球各地用户与开发者最多的掌声: 将自己走过的路公布出来,让其他人可以少走弯路,快速收敛到最优路径上,开源的意义就在于此。 更重要的是,开源被证明拥有不输于闭源的价值。 此前,由美国构建的闭源模型(如 OpenAI 的 o3 和 Anthropic 的 Claude 3 Opus)一直被视为行业标杆。而开源模型(尤其是中国的开源模型)通常被认为落后几个月。然而,DeepSeek 的 R1 和多模态模型 Janus Pro 彻底彻底改变了这一认知。 当开源模型能在性能上追平闭源对手,这可能会颠覆整个人工智能行业的生态。其低成本优势必将吸引更多开发者,最终可能在这场技术角逐中获胜。 使用容器 App 等方式,已经可以实现完全在手机端侧运行 DeepSeek R1 模型 | 图片来源:X 海外社交媒体上频繁出现这样的「反思」:AGI 时代,依靠着开源与合作,中国同样有机会比美国更先到达 AI 领域的下一个节点。 Eric Schmidt 在文章中呼吁,美国已经拥有世界上最好的闭源模型,为了保持竞争力,还必须支持一个充满活力的开源生态系统的发展。「开源和闭源竞争很可能会找到一种自然的平衡,为不同用户带来一系列不同的产品和价格点。」他说。 OpenAI(以及一众 AI 大厂)和 Deepseek(以及期待更多 AI 新锐)的理想状态,更应该是一幅太极图:闭源对开源、充裕对短缺、外扩对内修、大力对灵巧……看似相克,实则相生。 只有两者互补、而非对立,才有利于人类通向 AGI 之路。因为后者会带来对抗,而前者则能形成合力。 开放,才是未来 在对 DeepSeek 的赞誉之后,大洋彼岸的科技巨头与政府迅速转变态度,核心是在政策层面加速「封锁」。 1 月 29 日,在 DeepSeek「蒸馏」指控之后,白宫新闻秘书卡罗琳·莱维特(Karoline Leavitt)表示,美国官员正在评估 DeepSeek 对美国国家安全的影响。 30 日,Anthropic 的 CEO Dario Amodei 直接发文呼吁美国政府加强对中国的芯片管制。他认为 DeepSeek 的成功并未降低美国芯片算力的价值,相反在通往 AGI 的道路上,未来仍需要数百万块芯片、数百亿美元(至少)。只有继续加剧出口管制,才能保证美国的技术单极「霸权」。 同日,外媒援引消息人士的话称,美国正在考虑对售华芯片实施额外限制的可能性。报道指出,限制措施将涉及英伟达公司的 H20 芯片——这正是 Dario 在文章中建议要限制的芯片,过去由于其训练效率较低,它被允许出口。据消息人士透露,关于限制措施的决定很可能不会很快做出。 DeepSeek 还面临着来自现实物理层面的挑战。据网络安全公司奇安信的专家证实,自 1 月 28 日起,该公司遭遇了来自美国 IP 地址的持续网络攻击,包括 DDoS 攻击和密码破解等多种形式。两天后,攻击暴增百倍。 1 月 28 日,深度求索(DeepSeek)官网显示,其线上服务受到大规模恶意攻击 | 来源 DeepSeek 这些事件背后折射出的深层事实是:随着 DeepSeek 等中国科技公司的崛起,其极大地冲击了国外科技巨头,并动摇了美国长期以来的「科技霸权」。后者似乎想沿用过去的技术限制和封锁手段,维持其主导地位、阻止这一进程。 如果说过去主要封锁的是算力,现在则是同时封锁算力和模型。 但历史可能会证明,试图通过技术封锁来维持优势的做法终将失效。就像过去对算力的限制一样,这种封锁不仅无法阻挡创新,反而催生出了 DeepSeek 这样的巨大创新。 或许在迈向 AGI 的征程中,开放,才是真正的核心竞争力。 更何况,开源模型不是 TikTok 那样依赖互联网的在线服务,它自带「跨越封锁」的属性:如今不仅是高性能主机的用户可以在端侧运行 DeepSeek R1,有开发者甚至研究出了使用本地 App,让蒸馏后 1.5B 大小的 DeepSeek R1 能够完全离线端侧运行在 iPhone 上。这意味着它很难被真正封锁。 「美国的竞争优势长期以来依赖于开放科学、以及产业、学术界和政府的协同合作。我们应该重新拥抱开放科学的可能性,让其再次成为推动美国 AI 发展的动力。」Eric Schmidt 称。 科技从业者的普遍观点是,硅谷科技公司应该追求科技「领导力」而非「霸权」。因为后者必然引发抵抗,产生离心力,难以长期维持。而前者能促进合作,凝聚向心力,推动人类科技进步。硅谷当前确实拥有科技「领导力」,但若一味追求「霸权」地位,反而可能失去这一核心优势,最终作茧自缚被更多具有创新思想的创业者反超。 开放,才是真正的未来,DeepSeek 就是最好的代表。
数据显示TikTok流量已恢复至被下架前水平
鞭牛士报道,1月31日消息,据CNBC报道,Cloudflare Radar 的数据显示,TikTok 本月初暂时关闭后使用量下降了 85%,但目前其流量水平已几乎恢复。 Cloudflare 数据洞察主管戴维·贝尔森 (David Belson) 在一份声明中告诉 CNBC:自服务恢复以来,TikTok 相关域名的 DNS 流量持续恢复,目前比关闭前的水平低约 10%。 DNS 是域名系统的缩写,它将网站名称转换为浏览器用来访问互联网资源的 IP 地址。 Cloudflare Radar 是连接云公司的中心,它 使用 DNS 显示互联网趋势和见解,以监控全球互联网流量。 在美国最高法院决定支持前总统乔·拜登4 月签署的一项法律后,TikTok 在美国短暂关闭。该立法要求总部位于中国的字节跳动要么剥离其对 TikTok 的所有权,要么该应用将于 1 月 19 日在美国面临有效禁令。因此,苹果和谷歌为了遵守法律, 已将 TikTok 从美国应用商店中移除。 在总统唐纳德·特朗普表示将推迟执行禁令后,该应用程序重新上线,并在其上任第一天签署行政命令,将该法律的截止日期延长 75 天至 4 月 5 日。 与此同时,从弗兰克·麦考特到吉米·唐纳森(绰号野兽先生)等美国投资者, 都 提出要达成交易 ,将 TikTok 的所有权带回美国。 Cloudflare 的数据显示,尽管 TikTok 下线约 14 个小时,且未在苹果或谷歌应用商店上线,但总体而言,它仍成功在美国保留了大部分用户和创作者。 至于其替代产品,Cloudflare 的数据显示,临时禁令实施当天流量激增,随后一周流量水平稳步上升。 贝尔森表示,替代产品的流量在预期关闭前一周就开始增长,这得益于RedNote(在中国称为小红书)的日益普及。 但他补充说,TikTok 替代品的流量在 1 月 19 日(即 TikTok 重新上线的那天)达到顶峰。 贝尔森说:关闭结束后,DNS 流量迅速下降,并在过去一周半内持续缓慢下降。
意法半导体拟裁员6%:覆盖2000-3000人,让部分员工“提前退休”
1 月 31 日消息,据彭博社今日报道,意法半导体正在考虑通过提前退休和员工自然减少的方式,裁减大约 6% 的员工,以应对其在工业和汽车领域持续疲软的需求。 知情人士透露,这一裁员计划预计最快将在下月公布,涉及的员工人数可能在 2000 到 3000 人之间,将影响其在意大利和法国的业务。裁员决策尚未最终确认,裁减规模也仍在审议之中。 意大利政府与法国政府持有该公司 27.5% 的股份,目前正在努力减少重组对意大利员工的影响。意法半导体的一位发言人表示:“未来几周内,我们将与员工代表展开建设性对话,讨论基于自愿原则的‘职业生涯结束支持’项目,其中包括提前退休。” 意法半导体首席执行官让-马克・谢里(Jean-Marc Chery)在财报电话会议中表示,意法半导体正寻求削减成本,并计划为部分员工推出提前退休计划。他补充道,公司将与员工代表商讨自愿离职计划。由于行业低迷,这家总部位于日内瓦的公司多次下调财务预期,其股价在过去 12 个月已下跌超过 45%。 截至巴黎时间下午 1 时 18 分,意法半导体股价上涨了 1.5%,报 21.55 欧元(IT之家备注:当前约 163 元人民币)。 意法半导体成立于 1987 年,由法国和意大利的国有芯片制造商合并而成,至今仍被两国政府视为战略性企业。该公司为苹果和特斯拉等公司供应传统芯片,这些芯片技术较为陈旧,不需要最先进的生产设施。规模上,意法半导体目前拥有超过 5 万名员工。
上合组织秘书长:越来越多国家看到上合组织影响力的提升
   今年1月1日起,叶尔梅克巴耶夫正式担任上海合作组织秘书长。作为一名来自哈萨克斯坦的资深外交官,此前他曾担任上合组织副秘书长、哈萨克斯坦驻华大使等职务。多年的在华工作经历,让他十分熟悉中国春节。对于新一年的工作,叶尔梅克巴耶夫秘书长表示,将全力支持中方担任上合组织2024年—2025年轮值主席国的各项工作,推动上合组织实现提质升级。 你眼中的中国春节   上海合作组织秘书长 叶尔梅克巴耶夫:上海合作组织秘书处作为一个多国集体,庆祝春节这个可以拉近人们之间距离的美好节日。如今春节不仅仅是在中国庆祝,在许多国家,特别是东亚地区,以及所有有华人华侨的国家也都在庆祝,几乎遍及全世界。因此,将春节这个节日列入教科文组织人类非物质文化遗产代表作名录是一个非常重要和正确的决定。春节或许更能体现“上海精神”的原则,即尊重多样文明、谋求共同发展,这也是我们非常喜爱并珍视中国春节的原因。 双方合作新进展   上海合作组织秘书长 叶尔梅克巴耶夫:中国在上合组织担任轮值主席国期间确定了一个非常具有现实意义的主题:可持续发展年。中方作为主席国现已开始积极筹备本年度最重要的活动——上海合作组织成员国元首理事会,该会议将于今年在中国召开。在会上将通过一系列重要决议和文件,包括一些具有重大意义的政治文件,比如上海合作组织宣言。同时,《上合组织至2035年发展战略》这一重要文件也将在会上通过。 双方关系新期待   上海合作组织秘书长 叶尔梅克巴耶夫:从2017年到现在,7年多的时间,上合组织成员国数量从6个增加到10个。全球越来越多的国家看到上合组织建设性、和平、务实的性质,同时也看到其影响力和权威的提升。尤为重要的是,在中方担任主席国期间,上海合作组织正处于完善自身运作、提质升级的关键阶段。目前,上合组织各成员国都在全力支持中方担任主席国的工作,并且一如既往地团结协作,共同推动本组织目标的实现。   最后,叶尔梅克巴耶夫送上新春祝福:   我谨代表上海合作组织秘书处全体员工,祝愿正庆祝中国春节的朋友们身体健康,心情愉悦,与家人共度美好时光。在农历新的一年里幸福快乐,取得新的成功。尊敬的中国朋友们,我祝贺大家,祝春节快乐、万事如意。
苹果Vision Pro头显革新医疗,300名行业领袖探索如何重塑医疗体验
2 月 1 日消息,科技媒体 cultofmac 昨日(1 月 31 日)发布博文,报道称苹果 Vision Pro 头显在医疗领域大放异彩,其在手术及其他医疗场景中的应用潜力,引发医疗工作者广泛关注。 来自 10 个国家的 300 名医疗行业领袖近日齐聚圣地亚哥,参加由夏普医疗(Sharp HealthCare)主办的峰会,探讨 Vision Pro 如何进一步变革医疗流程和患者护理。 此次峰会标志着 Vision Pro 自 2024 年 2 月发布以来在医疗机构迅速普及的又一里程碑。虽然大众普遍期待更便宜的版本,但医疗专业人士却认为,与他们常用的设备相比,每台 3500 美元(IT之家备注:当前约 25432 元人民币)的价格已经相当低廉。 苹果公司全球开发者关系副总裁 Susan Prescott 表示,企业采用新技术有时需要一段时间,但 Vision Pro 的普及速度甚至超出了苹果的预期。 以上图源:夏普医疗 峰会将探讨 Vision Pro 在手术、医学教育和门诊病人护理等领域的应用。加州大学圣地亚哥分校健康中心 (UC San Diego Health) 的外科医生已使用 Vision Pro 完成了 50 多例手术。 Ryan Broderick 医生率先将 Vision Pro 用于微创手术,解决了手术室显示器杂乱、迫使外科医生处于不舒服姿势的问题。通过 Vision Pro 传输视频,手术团队可以优化虚拟显示器的位置,不再受物理限制。 Vision Pro 与苹果生态系统的整合也加速了相关苹果产品普及,夏普医疗的 Tommy Korn 医生指出,他们 90% 的医生都使用 iPhone。
库克AR战略受挫,古尔曼曝料称苹果消费级AR眼镜项目搁浅
IT之家 2 月 1 日消息,彭博社的马克・古尔曼(Mark Gurman)今天(2 月 1 日)发布博文,曝料称苹果公司内部已取消代号为 N107 的 AR 眼镜项目,标志着其打造吸引普通消费者的头戴设备努力再次受挫。 消息称 N107 项目打造的产品外观类似普通眼镜,但内置显示屏,需要连接 Mac 电脑使用。 苹果此前推出的 Vision Pro 因过于笨重和昂贵(起售价 3499 美元),而市场反响平平。N107 项目曾被视为 Vision Pro 之后 AR 战略的新方向,目标是打造一款日常用户能够接受的产品。 古尔曼透露苹果曾尝试改进 N107 的设计。最初,该眼镜计划与 iPhone 配对,但由于 iPhone 的处理能力和电池续航能力不足而遇到问题。 苹果后续转而将其与 Mac 电脑连接,但 Mac 连接版产品在高管评估中表现不佳,所需功能也不断变化,最终导致项目终止。 苹果公司在 AR 领域面临来自 Meta 等竞争对手的压力。Meta 已推出 Ray-Ban 智能眼镜,IT之家昨日报道称该眼镜的全球销量已经突破 100 万副。 Meta 还展示了正在开发的“Orion”AR 眼镜原型,但制造成本超过 1 万美元(IT之家备注:当前约 72663 元人民币)。Meta 计划在 2027 年发布这款眼镜,而苹果原计划也在同期推出 N107 AR 眼镜。 尽管 Vision Pro 初期销售缓慢,但其技术仍然令人瞩目。苹果首席执行官蒂姆・库克在财报电话会议上表示,越来越多的企业客户正在接受它。苹果仍在研发 Vision Pro 的后续产品,包括更新版本,以及其他概念产品。
美叫停对乌援助 欧盟能否填补空缺?专家分析→
  美国总统特朗普就职后签署行政令,要求美国所有对外援助暂停90天,据美国多家媒体29日报道,美国国务院已经停止对乌克兰的援助项目。   有媒体统计,美国在对乌援助问题上明显占据主要地位,那么,欧洲能否补上美国留下的窟窿?美国是否真的会对乌克兰“撒手不管”?   美欧各占一半援乌份额 欧盟难以填补空缺    北京外国语大学区域与全球治理研究院教授 崔洪建:尽管美国政府最近并未明确表明要停止对乌克兰的援助,但其传递出的一些信号已经让乌克兰方面感到非常紧张。俄乌冲突自爆发到现在,西方国家给乌克兰的援助中,美国和欧洲几乎各占一半。美国已经提供了超过800多亿美元的援助,主要集中在军事援助方面。而欧洲方面,除了欧盟框架内的援助外,其他成员国和一些欧洲国家提供的援助大概与美国持平,但主要份额集中在财政、经济、能源以及人道主义援助上。   美援乌主要在军事方面 欧盟无力填补   北京外国语大学区域与全球治理研究院教授 崔洪建:如果美国现在要在援助问题上后退,甚至是完全停止援助,对欧洲来说将很难填补这个空缺。一方面,如果缺少了美国这一部分援助,就等于少了整整一半的援助金额。从欧洲目前的财政状况以及对乌克兰的支持力度和意愿来看,欧洲实际上无力也没有意愿去填补这个空缺。   美退援乌 欧难补缺:乌军战斗力支撑面临挑战   北京外国语大学区域与全球治理研究院教授 崔洪建:另一方面,如果美国退出援助,有些方面欧洲根本无法补充。例如,在军事装备方面,无论是“海马斯”远程火箭炮系统、“爱国者”防空系统还是F-16战斗机,这些都是目前乌克兰战场上主要支撑乌军战斗力的装备,且都来自于美国的援助。如果美国在军事援助上后退或撤出,以欧洲目前的生产能力、军工能力以及武器装备的多样性来看,都无法与美国提供的援助相媲美。因此,在这样的情况下,乌克兰的焦虑和压力进一步传递到了欧洲。
特斯拉Model Q曝光汇总:秦Plus的对手来了
在电动汽车市场持续蓬勃发展的当下,每一款新车型的曝光都备受瞩目。特斯拉,作为该领域的领军品牌,其一举一动都牵引着消费者和行业的目光。近日,特斯拉 Model Q 的曝光,无疑给本就竞争激烈的市场扔下了一颗重磅炸弹,尤其是与比亚迪秦 Plus 之间,一场激烈的较量似乎已悄然拉开帷幕。 特斯拉Model Q曝光汇总 特斯拉Model Q采用两厢车造型,整体设计紧凑而灵动,有跨界旅行车的风格。前脸延续了Model 3的家族式设计,封闭式前格栅配上两侧的横向熏黑饰条,LED大灯组造型锐利,日间行车灯呈双L型。车侧线条流畅,隐藏式门把手不仅提升了整车的科技感,还有效降低了风阻系数,大尺寸的五辐式轮圈为整车增添了一丝运动气息。车尾部分简洁大方,虽未采用贯穿式尾灯,但层次感十足,部分设计有小尾翼以优化空气动力学性能。 有消息称Model Q车长为3988mm,长宽高分别为4400/1850/1550mm,轴距2750mm。也有预计长度在4米6以上,轴距在2米6以上的说法,车内空间表现良好,能够满足日常使用需求。 内饰配置上,目前虽无确切内饰信息,但根据特斯拉一贯风格,大概率会走极简路线,配备大尺寸中控屏,集成导航、娱乐、车辆设置等功能,方向盘可能采用飞机式设计。座椅方面,可能会采用环保皮革材质,在控制成本的同时提供一定的舒适性。 动力部分,特斯拉Model Q将搭载磷酸铁锂电池组,提供53kWh和75kWh两个版本的电池容量选择,对应的CLTC纯电续航里程分别为402km和500km左右,最高车速可达200km/h。动力系统提供单电机后驱和双电机四驱两种驱动方式,百公里加速时间仅需5秒左右,动力性能强劲,可满足不同消费者的需求。 作为特斯拉家族成员,Model Q很可能搭载最新版本的Autopilot自动辅助驾驶系统,像自适应巡航、车道保持、自动泊车等功能有望成为标配,此外OTA空中升级、智能语音控制等招牌功能也可能配备,但部分高级功能可能会是选装项目。 价格方面,特斯拉Model Q在北美市场起售价预计在3万美元以下,约合人民币21万元左右,如果在上海超级工厂投产,预计售价将进一步降至10万元人民币左右,具有较高的性价比。 特斯拉Model Q与秦Plus的竞争关系 价格方面:特斯拉Model Q预计起售价10万元左右,而秦Plus EV的价格区间在9.88~13.98万,秦Plus DMi起售价更低,在7万出头。Model Q的价格相对较高,但如果消费者更看重特斯拉的品牌和性能,可能会愿意支付更高的价格。 动力性能:Model Q百公里加速仅需5秒左右,动力强劲,是一款“小钢炮”车型;秦Plus EV搭载最大功率为150千瓦的永磁同步交流电机,最大扭矩250牛·米,050公里/小时的加速时间为3.8秒,加速性能也不错,但相比之下,Model Q的整体动力性能更胜一筹。 续航里程:Model Q的CLTC纯电续航里程根据电池容量不同可达402km和500km左右;秦Plus EV有420km、510km和610km等多种续航版本可选,从续航数据上看,秦Plus EV的高续航版本更有优势,但Model Q的续航表现也能满足大多数日常使用场景。 智能驾驶:Model Q可能搭载最新版本的Autopilot自动辅助驾驶系统,智能驾驶功能较为强大;秦Plus EV配备了L2级别的智能巡航和车道保持辅助系统等,但整体智能化程度可能稍逊于Model Q。 空间表现:秦Plus作为三厢车,车身尺寸较大,车内空间尤其是后排腿部空间相对更宽敞;Model Q作为紧凑型两厢车,车内空间在同级别中表现不错,但与秦Plus相比略显逊色。 综上所述,特斯拉 Model Q 凭借自身独特的设计、强劲的动力、先进的智能科技等优势,无疑将成为秦 Plus 在电动汽车市场上的强劲对手。至于这场竞争最终谁能更胜一筹,让我们拭目以待市场的检验。
DeepSeek梁文锋同乡:他回村短暂停留就离开,接到过同事电话,感到很光荣
三言科技消息,春节期间DeepSeek创始人梁文锋的家乡广东湛江吴川米历岭村走红,村内围满参观打卡人群 。村口和梁文锋家门口都聚集了大量拍照打卡的人,还有网红在村口直播。 据DV现场,梁文锋的同乡表示,梁文锋于1月28日(除夕)晚上回来吃年夜饭,初一也回来吃饭,之后就出去了。 他回乡后受到了村民的热烈欢迎。有村民在年廿九晚与他偶遇,称他非常低调热情。当时这位村民偶遇梁文锋后,梁文锋还邀请他过去喝水弹吉他,随后其电话响起,应该是公司的人在讨论有关公司的事情,之后村民与他匆匆打了个招呼。村民深深祝福,希望他保重,为国家做好这个软件。 家乡街坊表示,梁文锋作为从吴川走出的科技人员,让他们感到非常光荣和开心,认为这不仅是吴川的骄傲,更是全中国人民的骄傲,大家都为此感到自豪。 有人手提年货想赠送给梁文锋家属,遭到拒绝。梁文锋家属表示已收到大家心意,希望大家不要过多打扰他们的正常生活。 很多村民不知道他做的具体软件,只知道他在外面开公司。梁文锋每年都会给村里捐钱,比如村里要做大戏、过年例需要资助时,他总是第一时间提供资金,村民们称赞他很有爱心。此外,村民还提到梁文锋家4年前才盖了现在的楼,之前住的是两层未装修的砖瓦房。 同乡介绍他出身普通家庭,父母是教师 。2002年,17岁的梁文锋以吴川一中高考第一名的成绩,在先填志愿后考试的情况下,考入浙江大学本科电子信息工程专业,2007年又考上该校信息与通信工程专业研究生。他从小在当地长大,曾是吴川一中的高考状元。
无人驾驶出租车项目失败后,通用汽车押注辅助驾驶
1 月 31 日消息,据路透社 30 日报道,通用汽车正在积极推动以 Super Cruise 驾驶辅助技术为核心的技术战略,预计将为公司带来数十亿美元的收入。 在 Super Cruise 免手操作驾驶系统推出之际,恰逢通用汽车结束无人出租车业务 Cruise,后者专注于自动驾驶车辆并通过应用程序叫车,但亏损巨大。 通用汽车预计,Super Cruise 将在五年内创造约 20 亿美元(IT之家备注:当前约 145.33 亿元人民币)的年收入,帮助公司在技术领域的声誉与其在汽车领域的声誉相匹敌,达到“像特斯拉一样”的知名度。 晨星分析师大卫・惠斯顿指出,Super Cruise 的利润率远高于传统汽车制造,将有助于消费者更容易接受完全自动驾驶汽车的到来。 Super Cruise 与特斯拉的 Autopilot 功能相似,都是部分自动化驾驶技术,但它采用了更先进的传感系统,确保驾驶员始终保持对道路的关注。 目前,Super Cruise 已在大约 20 款新型高端燃油车和电动车上提供。部分车型标配该技术,另一些则为选配,客户需要支付 2200 至 2500 美元(当前约 15986 至 18166 元人民币)。该功能免费试用期为三年,之后客户可选择订阅服务,每月费用为 25 美元(当前约 182 元人民币),或每年 250 美元(当前约 1817 元人民币)。 通用汽车 CEO 玛丽・芭拉表示,辅助驾驶技术仍是公司未来增长的关键领域之一,预计到 2025 年,Super Cruise 的车队规模将翻一番,达到约 36 万辆。 她还透露,在 2024 年,约 20% 的 18000 名试用结束的用户选择继续订阅 Super Cruise 服务。2025 年,另外 33000 辆车的三年免费期将结束,通用汽车的目标是订阅收入增加一倍以上。
DeepSeek突围奥秘曝光,一招MLA让全世界抄作业!150+天才集结,开出千万年薪
DeepSeek这波强攻,彻底把OpenAI逼急了——深夜紧急上线o3-mini。 整整半个月,中国AI承包了国内外各大头条,影响力只增不减。 关于DeepSeek模型训练数据、GPU用量、成员构成、RL训练算法,早已成为所有人的关注焦点。 SemiAnalysis一篇深度报道中,从多个方面进行了推测——训练成本、对闭源模型利润影响、团队等等。 其中一些关键亮点包括: DeepSeek不是「副业」,在GPU等硬件支出远超5亿美元,论文中600万美元仅是预训练运行GPU成本,研发、硬件总拥有成本(TCO)被排除在外 DeepSeek大约有5万块Hopper GPU,包括特供版H800和H20 DeepSeek大约有150名员工,并定期从北大、浙大等招募顶尖人才,据称有潜力的候选人能拿到超130万美元(934万元)薪水 DeepSeek一个关键创新——多头潜注意力(MLA),耗时多月开发,将每个查询KV量减少93.3%,显著降低推理价格 o3性能远超R1和o1,谷歌Gemini 2.0 Flash Thinking与R1不相上下 V3和R1发布后,H100价格猛涨,杰文斯悖论(Jevonʼs Paradox)正发挥作用 5万块Hopper GPU,投资超5亿美金 DeepSeek背后顶级投资者幻方量化(High-Flyer),很早就洞察到了AI在金融领域之外的巨大潜力,以及规模化部署的关键重要性。 基于这一认知,他们持续扩大 GPU 投资规模。 在使用数千个GPU集群进行模型实验后,幻方在2021年投资购入了10,000块A100,这一决策最终证明是极具前瞻性的。 随着业务发展,他们在2023年5月决定分拆成立「DeepSeek」,以更专注地推进AI技术发展。由于当时外部投资者对AI领域持谨慎态度,幻方选择自行提供资金支持。 目前,两家公司在人力资源和计算资源方面保持密切合作。 与媒体将其描述为「副业项目」不同,DeepSeek已发展成为一个严肃且协调有序的重要项目。即使考虑到出口管制的影响,高级分析师估计他们在GPU方面的投资规模已超5亿美元。 据SemiAnalysis评估,他们拥有约50,000块Hopper架构GPU,这些计算资源在幻方和DeepSeek之间共享使用,并在地理位置上进行了分散部署,用于交易、推理、训练和研究等多个领域。 根据分析,DeepSeek在服务器方面的资本支出总额约为16亿美元,而运营这些计算集群的成本高达9.44亿美元。 150+顶尖人才,年薪934万 在人才战略方面,DeepSeek专注于招募中国本土人才,不过分看重候选人的过往履历,而是更注重其实际能力和求知欲望。 他们经常在北京大学和浙江大学等顶尖高校举办招聘活动,现有员工中很多都来自这些学校。 公司的职位设置非常灵活,不会过分限定岗位职责,招聘广告甚至强调可以自由使用数万个GPU资源。 他们提供极具竞争力的薪酬待遇,据报道为优秀候选人提供的年薪可达130万美元以上,远超其他科技巨头和AI实验室的水平。 目前公司约有150名员工,并保持快速扩张态势。 历史经验表明,资金充足且目标明确的创业公司,往往能够突破现有技术边界。 与谷歌等大公司的繁琐决策流程相比,DeepSeek 凭借自主融资的优势,能够更快速地将创新理念付诸实践。 有趣的是,DeepSeek在运营模式上却与谷歌相似,主要依靠自建数据中心而非外部服务提供商。 这种模式为技术创新提供了更大的实验空间,使他们能够在整个技术栈上进行深度创新。 在SemiAnalysis看来,DeepSeek已经成为当今最优秀的「开源权重」(open weights)实验室,其成就超越了Meta Llama、Mistral等竞争对手。 训练成本不止600万美金 DeepSeek的定价策略和运营效率在本周引发了广泛关注,特别是有关DeepSeek V3训练成本「600万美元」的报道。 但事实上,预训练成本仅是整体投入中的一小部分。 训练成本解析 高级分析师认为,预训练阶段的支出远不能代表模型的实际总投入。 据他们评估,DeepSeek在硬件方面的累计投资已远超5亿美元。在开发新架构的过程中,需要投入大量资源用于测试新理念、验证新架构设计和进行消融实验(ablation studies)。 比如,作为DeepSeek重要技术突破的多头潜注意力机制(Multi-Head Latent Attention),其开发周期就长达数月,消耗了大量的人力资源和计算资源。 论文中,提到的600万美元仅指预训练阶段的GPU直接成本,这只是模型总成本的一个组成部分。 其中并未包含研发投入、硬件设施的总拥有成本(TCO)等关键要素。 举例来说,Claude 3.5 Sonnet训练成本就达到了数千万美元。 如果这就是Anthropic所需的全部投入,他们就不会从谷歌筹集数十亿美元,更不会从亚马逊获得数百亿美元的投资。 这是因为他们需要持续投入实验研究、架构创新、数据采集与清洗、人才招募等多个方面。 算法优化,让性能差距缩小 V3无疑是一个令人瞩目的模型,但需要在合适的参照系下评估其成就。 许多分析将V3与GPT-4o进行对比,强调V3超越了后者的性能。这个结论虽然正确,但需要注意GPT-4o是在2024年5月发布的。 在AI快速迭代的背景下,半年前的技术水平已显得相对陈旧。 此外,随着时间推移,用更少的计算资源实现相当或更强的性能,也符合行业发展规律。推理成本的持续下降正是AI进步的重要标志。 一个典型的例子是,现在可以在普通笔记本电脑上运行的小型模型,已能达到与GPT-3相当的性能水平,而后者在发布时需要超级计算机进行训练,且推理阶段也需要多个GPU支持。 换言之,算法的持续优化使得训练和推理同等性能的模型,所需的计算资源不断减少,这种趋势在行业内屡见不鲜。 目前的发展趋势表明,AI实验室在绝对投入增加的同时,单位投入所能获得的智能水平提升更为显著。 据估计,算法效率每年提升约4倍,这意味着实现相同性能所需的计算资源每年减少75%。 Anthropic CEO Dario的观点更为乐观,认为算法优化可以带来10倍的效率提升。 就GPT-3级别的模型推理成本而言,已暴降1200倍。 在分析GPT-4成本演变时,高级分析师还观察到类似的下降趋势,尽管仍处于成本优化曲线的早期阶段。 与前述分析不同的是,这里的成本差异反映了性能提升和效率优化的综合效果,而非保持性能不变的单纯比较。 在这种情况下,算法改进和优化措施共同带来了约10倍的成本降低和性能提升。 值得强调的是,DeepSeek独特之处在于他们率先实现了这一成本和性能的突破。 虽然开源模型权重的做法,此前已有Mistral和Llama等先例,但DeepSeek的成就仍然显著。 考虑到行业发展趋势,到今年年底,相关成本可能还会进一步下降5倍左右。 R1与o1打平手,「推理」新范式 另一个引人关注的问题是,R1能够达到与o1相当的性能水平,而o1仅在去年9月才发布。 那么,DeepSeek是如何能在如此短的时间内,实现这一跨越的? 其关键在于,「推理」这一新范式的出现。 与传统范式相比,推理范式具有更快的迭代速度,且能以较少的计算资源获得显著收益。 正如SemiAnalysis在scaling law报告中指出的,传统范式主要依赖预训练,这种方式不仅成本越来越高,而且越来越难以实现稳定的性能提升。 新的推理范式,主要通过合成数据生成和在现有模型基础上进行后训练强化学习来提升推理能力,这使得以更低成本获得快速进展成为可能。 随着业界逐步掌握这一新范式的扩展技巧,高级分析师预计不同模型之间在能力匹配上的时间差距可能会进一步拉大。 虽然R1在推理性能上确实达到了相当水平,但它并非在所有评估指标上都占据优势,在许多场景下其表现甚至不如 o1。 OpenAI最近发布的o3测试结果显示,其性能提升几乎呈现垂直上升趋势。 这似乎印证了「深度学习遇到了瓶颈」的说法,只是这个瓶颈的性质与以往不同。 谷歌推理模型,实力相当 在R1引发广泛关注的同时,一个重要事实往往被忽视:谷歌在一个月前就推出了一款更具性价比的推理模型——Gemini Flash 2.0 Thinking。 这个模型不仅可以直接使用,而且通过 API 提供了更长的上下文长度。 在已公布的基准测试中,Flash 2.0 Thinking表现优于 R1,尽管基准测试并不能完全反映模型的真实能力。谷歌仅公布了3项基准测试结果,这显然不足以提供完整的对比。 即便如此,分析师认为谷歌的模型具有很强的稳定性,在多个方面都能与R1分庭抗礼,只是没有获得应有的关注度。 这可能部分源于谷歌欠佳的市场策略和用户体验,也与出乎意料的竞争者R1的到来有关。 需要强调的是,这些比较并不会削弱DeepSeek的突出成就。 正是凭借快速行动、充足资金、卓越智慧和明确目标的创业公司特质,DeepSeek才能在推理模型的竞争中超越Meta这样的科技巨头。 中国MLA创新,让全世界抄作业 接下来,让我深入扒一扒DeepSeek所取得的领先实验室尚未实现的技术突破。 SemiAnalysis高级分析师预计,DeepSeek发布的任何技术改进,都会被西方实验室迅速复制。 那么,这些突破性进展是什么? 实际上,主要的架构创新与V3模型密切相关,该模型也是R1的基础模型。 训练(前期和后期) 不是「下一个token预测」,而是「多token预测」 DeepSeek V3以前所未见的规模实现了多Token预测(MTP)技术,这些新增的注意力模块可以预测接下来的多个 Token,而不是传统的单个Token。 这显著提高了训练阶段的模型性能,且这些模块可以在推理阶段移除。 这是一个典型的算法创新案例,实现了在更低计算资源消耗下的性能提升。 其他方面,虽然DeepSeek在训练中采用了FP8精度,但像全球一些顶尖的实验室已经采用这项技术相当长时间了。 DeepSeek V3采用了我们常见的「混合专家模型」(MoE)架构,个由多个专门处理不同任务的小型专家模型组成的大模型,展现出强大的涌现能力。 MoE模型面临的主要挑战是,如何确定将哪个Token分配给哪个子模型(即「专家」)。 DeepSeek创新性地采用了一个「门控网络」(gating network),能够高效且平衡地将Token路由到相应的专家,同时保持模型性能不受影响。 这意味着路由过程非常高效,在训练过程中每个Token只需要调整小量参数(相较于模型整体规模)。 这既提高了训练效率,又降低了推理成本。 尽管有人担心MoE带来的效率提升,可能降低投资意愿,但Dario指出,更强大的AI模型带来的经济效益非常可观,任何节省的成本都会立即被投入到开发更大规模的模型中。 因此,MoE效率提升不会减少总体投资,反而会加速AI规模化进程。 当前,包括OpenAI、谷歌、Anthropic等一些公司正专注于扩大模型的计算规模,并提高算法效率。 V3打好了基础,RL立大功 对于R1而言,它极大地受益于其强大的基础模型——V3,这在很大程度上要归功于强化学习(RL)。 RL主要关注两个方面:格式化(确保输出连贯性)以及有用性与安全性(确保模型实用且无害)。 模型的推理能力,是在对合成数据集进行微调过程中自然涌现的,这与o1的情况类似。 值得注意的是,R1论文中并没有提及具体的计算量,因为披露使用的计算资源,会暴露DeepSeek实际拥有的GPU数量远超过其对外宣称的规模。 这种规模的强化学习需要庞大的计算资源,特别是在生成合成数据时。 谈到蒸馏,R1论文最引人注目的发现可能是,通过具有推理能力的模型输出来微调较小的非推理模型,使其获得推理能力。 数据集包含了约80万个样本,现在研究人员可以利用R1的思维链(CoT)输出创建自己的数据集,并借此开发具有推理能力的模型。 未来,我们可能会看到更多小模型展现出推理能力,从而提升小模型的整体性能。 多头潜注意力(MLA) 如开头所述,MLA是一项重要的技术创新,它显著降低了DeepSeek模型推理成本。 与标准注意力机制相比,MLA将每次查询所需的KV缓存减少了约93.3%(KV缓存是Transforme模型中的一种内存机制,用于存储表示对话上下文的数据,从而减少不必要的计算开销)。 KV缓存会随着对话上下文的增长而不断扩大,这会造成显著的内存限制。 通过大幅减少每次查询所需的KV缓存量,可以相应减少每次查询所需的硬件资源,从而降低运营成本。 MLA这项创新,特别引起了许多美国顶级实验室的关注。实际上,MLA首次在2024年5月发布的DeepSeek V2中就已推出。 此外,由于H20芯片比H100具有更高的内存带宽和容量,DeepSeek在推理工作负载方面获得了更多效率提升。 R1并非真正动摇o1技术优势 在利润率方面,SemiAnalysis发现了一个关键现象:R1并非真正动摇了o1的技术优势,而是以显著更低的成本实现了相似的性能水平。 这种现象本质上符合市场逻辑,接下来高级分析师将提出一个框架,来分析未来价格机制的运作方式。 技术能力的提升往往能带来更高的利润率。 这种情况与半导体制造业的发展模式极其相似,只是节奏更快。就像台积电每当率先突破新制程时,都能获得显著的定价优势,因为他们提供了此前市场上不存在的产品。 其他落后的竞争对手(如三星、英特尔)则会采取较低的定价策略,以在性价比上达到平衡。 对芯片制造商(在这个类比中,即AI实验室)来说,一个有利条件是他们可以灵活调整产能分配。 当新型号能提供更优的性价比时,他们可以将产能转移到新型号的生产上。虽然旧型号仍会继续支持,但会相应减少其供应规模。 这种策略模式与当前AI实验室的实际运营行为高度吻合,也反映了半导体制造业的基本规律。 率先破局者,手握定价权 这很可能就是AI能力发展的基本规律。 率先突破到新的能力层次,将带来可观的价格溢价,而那些能够快速追赶到相同能力水平的竞争者,只能获得适度利润。 如果能为特定应用场景保留较低能力水平的产品,这些产品仍将继续存在。 但能够追赶到领先能力水平的公司,将随着每一代技术更迭而逐渐减少。 所有人见证了,R1取得了领先水平,却采用了0利润率的定价策略。 这种显著的价格差异不禁让人质疑:为什么OpenAI的价格如此之高?这是因为他们采用了基于SOTA的前沿定价策略,享受着技术领先带来的溢价优势。 甚至就连刚刚上线的o3-mini,网友也不忘暗讽一下模型的定价 SemiAnalysis预计,AI未来的发展速度,将超过领先芯片制造业的发展节奏。 快速实现最新能力意味着可以保持定价权(如ChatGPT Pro),而能力落后则意味着更低的定价,主要收益将流向提供token服务的基础设施提供商。 当前正处于技术快速迭代的周期,我们将会看到产品以前所未有的速度更新换代。 只要科技公司能够通过scaling能力来开发出新功能,并在这些功能基础上创造价值,就应该拥有定价权。 否则,开源模型市场将在下一代技术中迅速商品化。 在这种背景下,高级分析师认为,市场存在一个「根本性的误解」。 芯片制造业是目前资本最密集的行业,虽然全球没有任何行业在研发投入上超过半导体行业,但这个最接近的现实类比实际上表明——模型公司发展态势越快,对高性能芯片的需求也越大。 将AI token与「杰文斯悖论」(技术进步提高效率反而增加资源消耗)进行比较时,我们可以发现深刻的历史相似性。 最初,业界并不确定是否能持续缩小晶体管尺寸,但当这一可能性得到证实后,整个行业都致力于将CMOS工艺微缩到极限,并在此基础上构建有意义的功能。 目前,我们正处于整合多个CoT模型和能力的早期阶段。 我们正在像早期缩小晶体管一样scaling模型规模,尽管这在技术进步方面可能会经历一段异常忙碌的时期,但这种发展趋势对英伟达来说无疑是利好消息。 免费,还能维持多久? 事实上,市场一直在寻找一个突破点,而这就成为了他们的选择。 如果DeepSeek愿意接受零利润率甚至负利润率运营,他们确实可以维持如此低的价格水平。 但显然,提供前沿token服务的价格弹性阈值要高得多。考虑到DeepSeek正在筹备新一轮融资,这种策略对他们来说是有其战略意义的。 DeepSeek刚刚在推理能力这个关键突破点上,打破了OpenAI的高利润率格局。 但这种领先优势能持续多久? SemiAnalysis对此持怀疑态度——这更像是一个开源实验室展示了它能够达到闭源实验室的能力水平。 高级分析师确实认为,一个更强大的开源实验室(而DeepSeek现在无疑是其中表现最好的)对新兴云服务提供商(Neoclouds)和各类服务提供商来说是重大利好。 无论采用开源还是闭源模式,计算资源的集中度仍然至关重要。 但如果上层服务提供商选择免费提供其产品,那么提升计算资源的商业价值就成为可能。 这意味着更多的资金将流向计算资源提供方而非闭源模型提供商,换句话说,支出将更多地流向硬件设施而非其他环节。 与此同时,软件企业也将从这一趋势中获得巨大收益。
前游戏公司总裁操作无人机与救火飞机相撞
Treyarch工作室联合创始人,空舞互动娱乐前总裁彼得·艾克曼(Peter Akemann)周五与控方达成认罪协议,协议规定可免于坐牢,但必须为山火救助工作提供150小时社区服务,外加飞机修理费65000美元。 艾克曼于1月9号驾车前往圣莫尼卡第三街附近,将车泊在停车场顶层,然后向帕利塞德地区发射无人机,以观察山火造成的损失。当时FAA已发布临时禁令,禁止无人机在火场附近飞行,禁飞区域包括帕利塞德。 艾克曼将无人机飞到2500米开外,失去目视接触,此后无人机与执行灭火任务的CL-415救火机相撞,在后者左机翼留下一个10x15厘米的大洞,导致救火机停飞。 受损的CL-415停飞数天等待维修。该型号飞机在水面滑行时只用12秒就能吸进6000升水,然后直飞火场,在水源地与火场之间来回穿梭灭火。 加州消防局拥有17架固定翼及旋翼飞机,但只有两架415,而且是从加拿大租来的。魁北克听说一架415被无人机撞坏后,又派了两架415前来支援: 新上任的美国总统对此投桃报李:加征25%关税。 艾克曼对自己的行为表示懊悔,愿意为此承担责任。但法院是否接受被告与控方达成认罪协议以免除牢狱之灾,现仍是未知数。艾克曼的轻罪罪名可判一年监禁,外加一年狱外行为监督,并处十万美元罚款或责任赔偿数额的两倍,以数额较高者为准。 56岁的艾克曼于1996年与他人共同创立Treyarch工作室,该单位在2001年被动视收购,并逐步成长为年货首席批发商。

版权所有 (C) 广州智会云科技发展有限公司 粤ICP备20006386号

免责声明:本网站部分内容由用户自行上传,如权利人发现存在误传其作品情形,请及时与本站联系。