行业分类:
加载中...
头条分类:
加载中...
英伟达、微软、亚马逊三家美国巨头同日接入DeepSeek
快科技2月2日消息,DeepSeek横空出世,让美国硅谷感受到了前所未有的压力。甚至那些平时对AI毫不关心的人,也感受到了来自中国AI的震撼。 俗话说得好:“打不过就加入”。美国三巨头已经相继接入DeepSeek,英伟达更是直言不讳地表示,DeepSeek-R1具备最先进推理能力。 1月31日,英伟达宣布,NVIDIA NIM已经可以使用DeepSeek-R1。NIM,即NVIDIA Inference Microservices,是一种云原生微服务技术,可简化生成式AI模型在云端、数据中心及GPU加速工作站上的部署流程。 英伟达官网发布文章指出,DeepSeek-R1是具备最先进推理能力的开放模型,比起直接提供响应,像DeepSeek-R1这样的推理模型,会对查询进行多次推理处理,使用连锁思维、共识和搜寻方法来生成最佳答案。 该文章写道,为了帮助开发者安全地试验这些功能,并构建自己的专门代理,DeepSeek-R1模型现已作为NVIDIA NIM微服务预览版上线使用。 曾经冲出来和OpenAI一起高调质疑DeepSeek“偷窃”数据的微软也于同日宣布,目前已将DeepSeek-R1正式纳入Azure AI Foundry,成为该企业级AI服务平台的一部分。 微软强调,DeepSeek-R1模型已通过“严格的红队测试与安全评估”,并经历“模型行为自动化检测与广泛的安全审查,以降低潜在风险”。 微软也在声明中提到,后续微软仍会持续评估DeepSeek-R1模型,并可能进行一定程度的调整与优化,以提升其准确度及审查机制。 亚马逊方面也表示,DeepSeek-R1模型现在已可以在Amazon Web Services上使用,该公司首席执行官安迪·贾西告诉用户“尽管用”。 与此同时,微博话题#DeepSeek成精# #DeepSeek拿捏人情世故# #DeepSeek高情商#等冲上微博热搜。 有网友评论称,“和DeepSeek对话太有意思了,它真的好懂”,还有网友评论表示,“DeepSeek双商都高,懂人情世故”“DeepSeek这是要成精”。
通过新加坡获取了AI芯片?美国对DeepSeek展开调查:英伟达回应!
2月1日消息,随着中国人工智能模型开发商 DeepSeek 的 AI 模型 R1 显示出与领先的 OpenAI O1相当的性能,美国开始担心DeepSeek将对其人工智能领导地位构成威胁,并对其展开了调查。据彭博社报道,美国政府正在调查DeepSeek 是否通过新加坡的中介绕过美国的出口限制,从而采购对华禁售的英伟达(Nvidia) AI GPU。 虽然DeepSeek 尚未透露用于训练其 R1 模型的具体硬件。但是,DeepSeek曾透露其使用了有限数量的 H800 GPU(2048 个 GPU)在短短两个月内使用 6710 亿个参数,280 万个 GPU 小时来训练其 V3 模型。相比之下,Meta 在 54 天内使用具有 16384 个 H100 GPU 的超级计算机,用 4050 亿个参数训练其具有 4050 亿个参数的 Llama 3 模型,计算资源增加了 11 倍(3080 万个 GPU 小时)。显然,DeepSeek R1 消耗的资源也比竞争模型少。但是,R1 也有可能在比 V3 使用的集群更强大的集群上进行训练。外界认为DeepSeek公司拥有5万张H100 GPU计算卡。 根据半导体研究机构SemiAnalysis则认为,DeepSeek囤积了6万张英伟达GPU卡,其中包括1万张A100、1万张H100、1万张“特供版”H800、3万张“特供版”H20,算力资本支出的总体拥有成本(TCO)超过140亿元,达19.96亿美元(约合人民币143.45亿元)。DeepSeek 的总服务器资本支出约为 16.29 亿美元,运营此类集群的成本高达 9.44 亿美元,因此总体的成本可能高达 25.73 亿美元。这一假设导致外界猜测DeepSeek依赖于非合规途径获得了大量对华禁售的英伟达AI GPU。 近年来,美国一直在持续收紧对向中国出口先进 GPU 的限制。2022年10月,美国正式推出了对华高性能AI芯片的出口限制,随后在2023年又进一步扩大限制范围,英伟达对华特供的A800/H800也受到了限制。与此同时,美国还限制了无需美国商务部出口许可证即可出售给中国和其他多个国家的 GPU 的性能。然而,新加坡此前并不在限制国家之列,因此有猜测认为DeepSeek是通过监管漏洞获得了英伟达高端 H100 GPU。 根据英伟达的财报显示,在两年之前的2023 财年第三财季,新加坡在英伟达总营收当中的占比仅为9%,当时正值美国升级对华AI芯片出口管制之际。然而到了2025 财年第三财季,新加坡在英伟达总收入当中的占比已经翻倍提高了22%。 因此,包括美国白宫和 FBI 在内的机构正在调查 DeepSeek 是否通过新加坡的第三方公司获得了受限的英伟达 AI GPU。根据该报告,代表 John Moolenaar 和 Raja Krishnamoorthi 呼吁采取严格的许可措施,除非新加坡加强对货物的监督。 但到目前为止,美国官员们尚未公开任何证据证实存在违规行为。英伟达则坚称它遵循所有法律要求。 英伟达公司澄清说,与新加坡的大多数交易都涉及运往其他地方的货物,而不是中国。英伟达是根据“账单”地点报告销售额,但这并不总是反映产品的最终使用地点。 “与新加坡相关的收入并不意味着转移到中国,”英伟达的一份声明中写道。“我们的公开文件报告说,我们客户的'账单地址'而不是'发货地址'。我们的许多客户在新加坡设有业务实体,并使用这些实体销售销往美国和西方的产品。我们坚持要求我们的合作伙伴遵守所有适用的法律,如果我们收到任何相反的信息,请采取相应的行动。” 值得一提的是,受DeepSeek引发的“中国在AI领域正超越美国”的威胁论影响。当地时间1月29日,美国密苏里州共和党参议员乔希・霍利(Josh Hawley)还提出了一项旨在保护美国人工智能(AI)发展不受中国影响的法案——《2025年美中人工智能能力脱钩法案》(Decoupling America’s Artificial Intelligence Capabilities from China Act),希望禁止从中国进口或向中国出口人工智能技术;禁止美国公司在中国进行AI研究或与中国公司合作开展AI研究;禁止美国公司投资中国的AI开发。 另据美联社报道,美国得克萨斯州的州长、共和党籍政客格雷格·阿博特于当地时间本周五签署了一项行政令,宣布从当地政府拥有的电子设备中封杀近日在美国爆火的中国的人工智能服务DeepSeek以及社交平台小红书。
阿里再上春晚,传递什么信号?
蛇年春晚,王菲回来了,一首《世界赠予我的》,惊艳亮相。她上一次出现在春晚舞台还是7年前。那次与那英的再牵手,引无数人感怀。 历史不会重复,但会押韵。 或许很多人没有意识到,今年,经历多事之秋的阿里也再次回到聚光灯下,成为2025年总台春晚唯一电商互动平台,阿里云则成为今年春晚的云计算AI独家合作伙伴。 阿里上一次冠名春晚也是在7年前,抢红包、清空购物车成了很多人对那年春节的共同记忆。 相比于品牌曝光和市场声量,今年阿里重返春晚还蕴藏着一个更强烈的信号——当年意气风发的阿里巴巴正在回归,而且是带着云计算和AI以硬科技的形象重新站到舞台中央。 春晚独家伙伴有符号特征,不仅是商业选择,也要“政治”过硬。当前,科技创新和产业升级已是大势所趋,而算力、AI、人形机器人等硬科技正成为全球竞争主战场。 这也使得无论是从公司战略的角度,还是从大国竞争的角度,硬科技的底色都成更关键的胜负手。 01 AI味儿最浓的一届春晚 春晚的地位已无需多言,作为全球华人最关注的节目,尽管最近几年,不少人吐槽春晚的小品不够好笑,节目形式不够新颖。但这并不妨碍春晚的地位和影响力,收视率吊打一切晚会节目。 今年,顶流依旧,雷打不动。 很多人对春晚多少有些误解,觉得这是父母一辈才会喜欢看的节目,没有新鲜东西。事实上,这些年春晚一直在紧跟时代节奏,引入了很多新技术和黑科技,俨然成了硬科技的风向标。 比如龙年春晚,李白的AI虚拟形象出现在西安分会场的上空,一曲将进酒,上演了一场跨越古今的时空对话。而一只突然出现的圆滚滚的3D卡通AI虚拟大熊猫,和现场明星一同打起了八段锦,萌翻全场。 牛年春晚,刘德华和周杰伦的节目是通过AR技术来呈现,两人的3D建模形象与现场嘉宾实现无缝表演。但因为逼真的演出效果,使得很多人都在真诚发问:刘德华和周杰伦到底来没来到现场。 时间更早的猪年春晚,540个智能机器人表演了舞蹈《心中的英雄》,动感的节拍跳得比人类还整齐。而这一年阿尔法狗战胜了世界围棋冠军,火爆出圈。此后几年,机器人已经成了春晚的常客。 今年春晚的主角肯定少不了AI,这个当下公认的最具想象力、也是竞争最激烈的赛道。 会扭秧歌的机器人昨晚让不少人忍俊不禁。不过你可能不知道,许多让观众大呼精彩的舞台效果,背后也是AI在支撑。 比如,甄子丹领衔的《笔走龙蛇》武术表演,不少观众惊呼看到了“天空环绕视角”。演员的动作看起来有“时空凝结、移步异景”的效果,一个个武术动作精彩的瞬间都 被定格下来。这背后就采用 了先进的AI技术对画面进行3D模型重建,将拍摄画面融合渲染,形成一个完整立体的3D视频图像,观众看到 的其实是物理摄像机无法拍摄的影像。 这类技术最早出现在了科幻电影《黑客帝国》里躲避子弹的经典画面,因此也被称为子弹时间。其实它有一个更专业的名称,云上AI多视角呈现。春晚演播大厅就部署了一套由30台相机阵列组成的云上多视角拍摄系统。 《笔走龙蛇》 武术表演正是基于这套系统,在通义大模型的算法能力和云计算的加持下,对多机位信号进行实时3D云渲染,同时通过智能虚拟运镜手法,最终给观众展现出了演员武术动作不同角度下的多个微妙细节。 “子弹时 间”不久前还被阿里云带到了巴黎奥运会的赛场上,小轮车、乒乓球、篮球比赛的精彩瞬间在空中被定格,然后镜头以360度环绕,呈现在观众眼前,体育的瞬间美感在这一刻被放大和定格,广受好评。 舞台效果创新上,莫文蔚、毛不易的歌曲节目《在岁月里的花》也不遑多让。两位歌手在油画画框里表演节目,观众眼前呈现出了一幅虚实交融的景象。这背后也是阿里云的技术支持。通义万相模型将舞台实景转化成了静态油画,模型精准捕捉到了舞台光影细节,模拟出了油画笔触的层次感和肌理。 据说,在后续节目中,阿里云大模型AI技术还将为舞台设计提供风格迁移、参考图生成、风格化处理等技术能力,为节目创新提供技术支持。 其实,互联网大厂亮相春晚不是新鲜事。2015年腾讯的微信红包在春晚一炮打响,之后互联网大厂一直在春晚冠名上唱主角。比如阿里集团前后就冠名了四次。 但以前上春晚的基本是电商或者社交平台,而云计算AI独家合作伙伴提法还是首次。 本次春晚,基于阿里云全球云转播技术,全球观众云上看春晚,许多用户通过互联网和移动互联网观看春节联欢晚会的需求得到了满足。 而阿里冠名春晚背后,其实也有不少门道。这是一个特殊的舞台。阿里离开这个舞台已有好几年。 当下,历史的车轮正在滚滚进入以大模型技术为代表的硬科技时代。 在平台经济进入常态化监管阶段,经历了内部战略重新聚焦的阿里,以硬科技的一面,再次回到了这一暌违七年的特殊舞台。 02 聚焦主业,一个硬科技阿里浮出水面 过去一两年,外界能看到一个在不同战线频繁动作的阿里。 首先是,收缩的动作异常坚决,比如线下零售领域即使被外界评价“赔本”也要执行。 从2023年3月,阿里卖出3300万股小鹏汽车股票开始,之后阿里在一年多时间里陆续清空了1000万股B站股票,843万股挚文集团以及光线传媒的股票。在线下零售领域,阿里卖掉了此前收购的子公司银泰百货、高鑫零售。 同时阿里还叫停了内部一些非核心子业务的IPO动作。2023年11月叫停盒马IPO,4个月后撤回了菜鸟上市申请,到今年1月菜鸟进一步分拆。 其次是电商板块组织架构及业务整合动作不断。 阿里重提电商的创业初心,内部从偏重天猫调整到战略上重视“万能的淘宝”;在用户体验驱动下,阿里甚至以前所未有的开放生态,接入了微信支付、京东物流。去年年底则进一步整合国际国内电商业务,将淘宝天猫集团、国际数字商业集团等业务为阿里电商事业群,以实现更好协同。 另外,在云计算和AI领域,阿里又显现出了一副略显激进的积极进攻态势。 对阿里云而言,下调云计算产品价格,其实是保留动作。阿里云将之定义为把技术进步带来的成本降低让利给市场。去年2月,阿里云再度降价,这次号称史上最大力度降价,100多款产品平均降价20%,最高降幅达55%。它也给当时正渴求健康持续发展的其他云厂商带来了不小的压力。 在大模型赛道,阿里称得上饱和式投入,存在感也惊人。业界观察到,这波大模型创业浪潮,阿里先后投资了国内几乎多数大模型创业公司。2023年云栖大会上,阿里云宣布除了通义大模型,中国一半大模型公司跑在阿里云上。 不同业务板块,动作逻辑不一。这背后,一方面是大众都能观察到的——过去一年半,吴泳铭上任阿里CEO之后,阿里战略快速聚焦,从一家业务庞杂的复杂公司,迅速收拢到了电商和AI硬科技这两大主业上。 还需要强调的则是,阿里正在以前所未有的决心和投入砸向了未来。电商阿里之外,一个硬科技阿里已经浮出水面。 电商作为阿里起家的业务,也是大众对阿里最熟悉的标签。它占据阿里营收的主体,贡献了主要的利润,也是创新业务的输血角色。过去几年,阿里在这一领域遭遇了新生代对手的强劲冲击。吴泳铭主导的一系列动作,目标都是让阿里电商业务快速止血,重新轻装上阵,稳住基本盘。 而非核心业务的极速收缩,则与AI硬科技业务加大战略投入是一体两面。 阿里的非核心业务,不少源于此前阿里的履带式发展模式下的战略防御布局。当时阿里期望不同成长周期的业务能像履带的各个部分一样,依次推动公司增长。 而这波大模型浪潮来临,生成式AI因其有可能重构人类知识生产、信息处理和创新协作的方式 ,正 迅速成为全球产业竞争的焦点。 随着新一轮全球竞争焦点明确,可以说,阿里也明了形势,如果不能在大模型硬 科技领域领先,即使有再多的履带业务,也很难实现基业长青。这一背景下, 阿里迅速从多点押注未来,转为在核心竞争场饱和式投入,硬科技B面显现出来。 对阿里而言,这种投入并非机会主义式的押注,阿里此前在这一赛道已经投入超十年。以云计算领域为例,十几年前,其他厂商对云计算这一新生领域的前景还多有质疑,只有阿里当时最坚定投入。2009年时马云表态,每年投1 0亿,投10年,做不 出来再说。而当年阿里的全部利润也就10个亿。 这也是国民级平台公司才能有的投入力度。它也带来了不少大胆、原创的想法,比如用科技去创新城市管理,用数据来变革工业制造等。 一些场景在当时甚至被人诟病“画大饼”。但事后回想,敢天马行空投入创新本身,也是平台级公司的底气和意气。它也使得杭州城因此聚集了国内新一线城市里最高的人才密度。某种程度而言,今天杭州城创新频发,不能不提城市科技龙头以及围绕着它的人才及创新外溢的作用。 十余年持续输血,阿里砸出了“科技”的B面。根据Gartner数据,亚太市场目前阿里云市场占有率,位居第一。硬科技阿里走到了台前。 03 大国竞争,也是科技公司的竞争 中美科技竞争背景下,春晚聚光灯第一次打到了硬科技企业上,某种程度,这也是中国头部科技公司要承担的时代课题。 过去几年里,AI等前沿科技领域一直是大国角力场。特朗普重返白宫不过一周多,全球科技竞争加剧的势头已经显现出来。 入主白宫第二天,特朗普就宣布了“星际之门计划”(The Stargate Project),旨在维持并扩大美国在人工智能领域的领先优势。4年5000亿美元,软银孙正义出钱,OpenAI奥特曼出力。虽然被马斯克阴阳怪气,但美国在AI领域的紧迫感呼之欲出。 几天后,特朗普又签署总统令设立总统科学与技术顾问委员会(PCAST),调整美国科技政策,整合各方资源,推动和巩固美国在人工智能、自动驾驶、超级计算系统等领域的领先地位。 就在美国以国家之力确保科技优势之际,几天前,国内公司发布开源模型DeepSeek-R1,引发了硅谷不小震动。 一是训练效率和成本。中国企业凭借算法创新、工程能力以更低成本推进AGI,这引起了硅谷焦虑。二是中国的开源模型正展现出比海外闭源厂商更强的能力。 以这一事件为契机,硅谷科技圈正全面审视重新评价,来自中国的竞争对手们。 可以想见,接下来,从算力、AI到人形机器人等各大前沿领域,大国角力会迎来更为白热化竞争。 大国竞争,说到底,最终是头部科技企业间的PK。 算力领域,美国AI巨头的动作已不能只用“势头凶猛”形容。谷歌、微软、xAI、Meta等AI巨头已争相建立十万卡集群,xAI甚至宣布建设更大规模集群。星际之门计划之后,有预测称美国可能会进一步垄断高性能芯片从而狙击中国AI。 过去一年多地已掀起了智算建设热潮。但目前,国内仅有两三家企业宣布具备十万卡集群的建设能力,阿里是其中之一。 与此同时,智算热潮里,基础设施利用率仍待提升已是行业共识。在可能遭遇更严苛算力限制的背景下,如何更高效利用计算资源,是国内科技发展必须攻克的课题。 要破题,除了要能低成本训练大模型,还需要充分发挥AI生态中不可或缺的一环——云计算厂商的能力。毕竟云计算本质是更高效利用基础设施,而大规模调度算力、更高效利用集群资源是头部云厂商的保留能力。 未来国内的算力基础设施能否进一步被激活,可能关乎国内AI发展大局。阿里作为目前云计算全球排名前四,仅次于亚马逊AWS、微软Azure、GoogleGCE,也是中国排名第一的云厂商,是这场大角逐里不可或缺的力量。 而在AI模型领 域,中国打的是明牌。 相比美国头部企业OpenAI走闭源路线,中国目前有不少开源模型在海外广受好评,比如阿里Qwen和DeepSeek都在技术社区和开发者群体里就口碑颇佳。 针对最近国内模型刷屏,Meta首席科学家YannLeCun指出,正确解读是开源模型正在超越专有模型。因为它的成绩得益于开源研究和项目(例如PyTorch和Llama), 而其他人也会从它的开源中受益,这是开放研究与开源的力量。 与之相对,美国对开源的态度则经历了摇摆。此前国内模型在追赶阶段,美国科技界反对Meta开源Llama,以杜绝中国获得技术。但伴随着国内开源模型受到广泛好评,美国科技圈又担心自己的监管使中国成为人工智能中心。特朗普上任几个小时后马上就撤销了拜登威胁限制开源技术的行政命令。 面对一个日益保守,四处挥舞长臂管辖大棒去维系竞争优势的美国,中国企业和工程师们积极参与全球协作竞争,反而有利于把朋友搞得多多的。 阿里Qwen开源模型,未来预计也会进一步拥抱开放开源,推动国内大模型技术的落地和大模型生态构建。 人形机器人,也是中美角逐点,对两国而言都既是产业问题也是政治问题。目前美国企业长处在算法,而国内在机器人产业链的完整性以及优越的供应链能力上表现突出。接下来的角逐里,云厂商的MaaS生态能力对人形机器人算法训练不可或缺。从这个意义上,聚焦硬科技的阿里也是这一领域竞争的重要参与者之一。 总结看,一个回归主业,押注科技主赛道,投身全球产业核心竞争场的阿里,已经是这场竞争里国内不可或缺的战力之一。 这可能也是硬科技阿里站到舞台中央的原因。
主机大战落幕 场上只剩索尼
Kotaku刊发了一篇文章,标题是“战争结束,没有赢家”: 该文称,主机大战可能在几年前已分出胜负,2025年不是终战的确切年份,各条战线仍残留小规模冲突,这只是惯性使然,比如索尼仍会发售新主机,但主战场已空无一人,PlayStation正在与空气作战。 微软转型为软件发行商,任天堂偏安一隅,早已退出这场大战——Wii U是它最后一次试图逐鹿中原,自Switch开始便不理睬对手的路数,自说自话免战高悬:经营好自己的一亩三分地,自然会有第三方厂商上门献殷勤。 微软将《极限竞速:地平线5》拱手献给索尼等同于求和,接下来可能还有《士官长合集》与《战争机器》三部曲合集(重制),甚至《神鬼寓言》与若干第一方新作会同步登陆PS5平台。 微软的中途岛计划失败了,该计划始于初代Xbox,微软内部将其称为“中途岛”,代表了一雪前耻痛击小日本的决心。多年来两个对手你来我往,见招拆招,百万粉丝沦为战犯二十年如一日口诛笔伐甚至相约中山公园,此情可待成追忆,只是当时已惘然…… Xbox输了,但XGP成了。历经八年修炼,蛇年方才得道,让我们看一下今年上半年XGP阵容: 《使命召唤:黑色行动 6》 《潜行者 2:切尔诺贝利之心》 《夺宝奇兵 2:古老之圈》 《忍龙2黑》重制 《永恒联结》(Eternal Strands) 《狙击精英:抵抗》(Sniper Elite: Resistance) 《公民沉睡者 2》(Citizen Sleeper 2) 《Avowed》(黑曜石新作) 《Atomfall》(狙击精英开发单位新作) 《午夜以南》(第一方新作) 《光与影:33号远征队》(回合制RPG,Sandfall工作室处女作) 《毁灭战士:黑暗时代》(id Software新作) 与友商施舍窖藏不同,Game Pass的卖点在于新作首发入库。上述名单仅录入截至今年五月已确认日期的新作,至于六月之后还有哪些内容,可以说《上古卷轴4》重制版、寓言新作、忍龙4、《战争机器》重制是可以期待的,将来还有《战争机器》新作与年货新作。 如果将视线再放远一些,杯赛的老滚与辐射是必然的,暴雪磨了这么多年洋工是否有像样的新作?黑曜石得到父爱后能否爆发?新维加斯的编剧在外面兜了一圈又回到黑曜石,尽管他矢口否认回归与新维加斯2无关。 按PlayStation前任高管亚当·博伊斯(Adam Boyes)的话来说,微软正在成长为游戏领域的网飞,而索尼就是专注精品战略的HBO。
OpenAI坐不住,说明中国大模型路走通了
国产大模型在春节期间的一轮轮产品更新,终于让OpenAI坐不住了。 北京时间2月1日,OpenAI加急上线了o3-mini新推理模型,且首次向ChatGPT免费用户开放。 来自国产大模型的这波竞争压力,甚至重新让部分海外同行担忧起美国AI的竞争力问题。 近期,前OpenAI高管、AI初创巨头Anthropic创始人达里奥·阿莫迪 (Dario Amodei),罕见发布了一篇万字长文。在肯定DeepSeek-R1模型在特定基准测试中已逼近美国顶尖水平之外,阿莫迪认为DeepSeek的突破,更加印证了美国对华芯片出口管制政策的必要性和紧迫性。 而这轮国产AI力量中,在DeepSeek发布DeepSeek-R1模型的几乎同一时间,月之暗面也推出了Kimi k1.5新模型。 上述两款推理模型,均全面对标OpenAI o1完整版。其中,Kimi k1.5凭借同时支持文本和视觉推理的特性,成为首个可以比肩o1完整版水平的多模态模型。 尽管OpenAI展现了下一阶段大模型的技术演进路线,但直到DeepSeek-R1和Kimi k1.5发布之前,国内一众大模型厂商均尚未推出能够对标OpenAI o1完整版的模型。它们的出现,成了国产大模型攻破OpenAI技术黑匣子的又一次实力展示。 更重要的是,相比OpenAI o1模型付费使用的限制,无论DeepSeek-R1,还是Kimi k1.5,都支持用户免费无限调用。 堪比OpenAI o1完整版的模型性能,加上免费调用的差异化竞争优势,DeepSeek-R1和Kimi k1.5新模型,成了春节期间国内大模型对OpenAI发起突然袭击的两把尖刀。 借助春节舞台,完成某种后来居上式的战略调整,已演变为中国科技公司的保留节目。 2014年春节前夕,微信首度推出红包功能,未能掀起太多水花。转折发生在2015年,借助与春晚合作,斥资5亿元推出“摇一摇”红包的微信,在除夕当天使得微信红包收发总量超10亿次,并在2天内完成了支付宝此前花费10年完成的工作——2亿张银行卡绑定。 微信红包的此番逆袭,后来被马云在阿里内部称为是对支付宝的一场“偷袭珍珠港”,并促使阿里在2016也开始重金赞助春晚,通过“集五福”的形式大撒红包。 现在,被DeepSeek-R1和Kimi k1.5新模型突袭过后的OpenAI,也不得不调整了自己的新品发布节奏。 在国产大模型的快速技术迭代和模型性能追赶压力之下,即便是OpenAI,恐怕也受不了几次这样的突袭了。“我们会开发出更好的模型,但我们不会像往年那样保持那么大的领先优势了。”OpenAI CEO奥特曼在o3-mini发布后的问答环节中说道。 DeepSeek-R1和Kimi k1.5新模型一经发布,便在海外用户群中引发热议。 英伟达AI科学家Jim Fan第一时间发帖总结两大模型的相似之处,认为两者都简化了强化学习框架,同时提升了推理性能和效率,并评价两家公司所发表的技术论文,都堪称“重磅”级别。 伯克利人工智能博士,Huggingface机器学习科学家Nathan Lambert、科技大V AK等也纷纷试用kimi,还有不少业内人士对这两款来自中国的产品进行了测评。 与DeepSeek-R1一样,Kimi k1.5新模型同样展现出了详细的思考过程。 北京时间1月31日,苹果发布了新一季度财报,以此为契机,选中Kimi k1.5推理模型,输入提示词“写一篇苹果财报分析稿,其中尤其要关注中国市场的变化,以及苹果AI何时在国产iPhone中上线的情况”。 经过一段时间思考,Kimi给出了苹果2025财年第一财季的业绩报告数据,并特意指出其中大中华区营收为185.13亿美元,同比下降11%。 除了给出联网参考的94个网页信息之外,Kimi还列出了自己的详细思考过程。 如果将大模型看作一个数学家,没有加入推理功能之前,大模型在证明了一个新的定理,或者解了一道新的数学题时,只会把答案写出来,不会把思考的过程写出来。但是,有了推理功能的加入,现在大模型就可以把原本只存在于数学家个人头脑中的思考过程,给尽可能完整呈现出来。 Kimi k1.5推理模型的思考过程,颇有点“授人以鱼不如授人以渔”的作用,将其用来指导学生学习,或者辅助程序员编写代码等,都有了更强的实际用途,大模型从有用,逐渐变得真正好用起来。 更重要的是,相比DeepSeek-R1,Kimi k1.5还是OpenAI之外首个实现o1完整版水平的多模态模型。 在Kimi k1.5推理模式下,上传一张苹果最新一季财报的数据图表,并给出提示词“给出图中大中华区的营收情况,以及同比变化,并分析大中华区营收占比”。 Kimi不仅读懂了图片中的营收数字,还通过列出数学公式的方式,准确算出了大中华的营收同比下降了11%,且营收占比也从去年同期的17%,下降至今年的15%。 杨植麟曾在一次采访中解释道,长文本就是某种意义上的长推理,“如果我们想让AI从完成一两分钟的任务变成完成长周期的任务,那必然要在一个很长的context(上下文)里,才有可能真正把AI进一步往下推进。” 加入图片识别等多模态功能,在某种程度上也可以看作是对长文本准确率的一种提升,这种提升,未来还可能随着无损压缩视频多模态的融入,变得更加强大。 对人才的重视和培养,成为DeepSeek和月之暗面能够率先做出对标OpenAI最新模型o1的共性之一。 在DeepSeek目前约150人左右的团队中,大多是一帮Top高校的应届毕业生、没毕业的博四、博五实习生,以及一些毕业才几年的年轻人。 从2023年初成立至今,月之暗面更是长期被视为中国大模型创业公司中,技术人才密度最高的玩家之一。 在Kimi k1.5中,月之暗面团队找到了一种提升推理效率的原创技术,即Long2Short高效思维链。 在o1模型中,OpenAI一般依赖于逻辑链条(Chain-of-Thought,CoT)来逐步推导出解决方案,这是一种用时间换取精准答案的方法。 月之暗面团队开发的long2short技术途径,把长思维链(复杂的推理过程)的推理结果“教给”短思维链(简单高效的推理过程),两者进行合并,最后针对“短模型”进行强化学习微调,从而达到提升token利用率以及训练效率的目的。 在Short CoT(短文本)模式下,Kimi k1.5的能力同样大幅领先GPT-4o和Claude 3.5,领先幅度高达550%。 良好的产品使用体验正在给Kimi带来用户量的增长。根据SimilarWeb 2024年12月的数据,Kimi在web端排名全球前五,仅次于ChatGPT、Google Gemini、Claude和Microsoft Copilot。 在DeepSeek和Kimi们的突袭之下,来自OpenAI等对手的一轮新竞争,已经在赶来的路上。 奥特曼预告中的OpenAI 新模型o3-mini紧急上线,甚至新一代高级语音模型也发布在即,为了在追求AGI道路上走得更快,奥特曼更是联手软银孙正义,搞起了5000亿美元的算力开发大计划。 可以预见,追赶的压力,或许很快便会再次来到国产AI们的头上。 但通过DeepSeek-R1和Kimi k1.5新模型的这番突袭,一个值得关注的新变动是,国产大模型正在向外界越来越多地证明其自主创新能力,甚至不排除有一天完成对OpenAI的真正超越。 近期,Meta首席AI科学家杨立昆(Yann LeCun)在达沃斯“技术辩论”会议上再次提醒道,“我认为当前LLM(大语言模型)范式的生命周期相当短,可能只有三到五年。五年内,任何清醒的人都不会再使用它们了,至少不会作为AI系统的核心组成部分……我们将看到一种新的AI架构范式的出现,它可能不会有当前AI系统的那些局限性。” 对于任何立志于实现AGI的大模型玩家而言,追赶OpenAI都绝不是公司成立的初衷和目标,OpenAI与国产大模型之间的差距,正在逐渐缩小已是不争的客观现实。 斯坦福大学计算机科学系客座教授、谷歌大脑联合创始人吴恩达(Andrew Ng)近期发文指出,DeepSeek的讨论让许多人认识到一些显而易见的重要趋势,其中之一便是中国在生成式AI领域正赶超美国。 2022年11月ChatGPT刚刚推出之际,美国在生成式AI领域远远领先中国,这一领先差距被业内认为在2-3年之间。但经过两年发展,OpenAI对国产大模型的领先优势已经被收缩到6个月。 通过Kimi、DeepSeek等模型的持续突破,“中国企业展现出强大的创新能力,在视频生成等特定领域甚至已经实现了局部领先。”吴恩达点评道。 国产大模型在技术上的快速迭代能力,甚至引得奥特曼在o3-mini的问答环节中,也不得不正视道,OpenAI的领先优势不会再像往年那么大了。 归根结底,大模型所蕴藏的无限技术创新空间,为国产大模型玩家们,在打造产品差异化方面提供着无限机遇。 更广阔的AI创新前景,也将孕育出更多国产大模型的奇袭时刻。
消息称AMD将在3月同时推出锐龙9 9000X3D处理器和RX 9070显卡
2 月 2 日消息,AMD 旗下 12 核和 16 核 Zen 5 处理器将于本季度推出。法国媒体 Cowcotland 在 1 月底的消息来源称,AMD 的两个新的 X3D 处理器预计将在 3 月底发布,大约与新的 Radeon RX 9070 和 RX 9070 XT 显卡发售日期相同。 Cowcotland 表示这是一个接近零售渠道的可信来源,但没有提供进一步的细节。 华擎已在其官网上公布了锐龙 9000X3D 系列处理器的 CPU 支持列表,暗示这两款处理器将会在近期上市。 锐龙 9 9950X3D 将配备最高 5.7 GHz 频率,与 9950X 相同,并且 TDP 均为 170W 。该处理器拥有总共 144MB 缓存,明显高于非 X3D 版本的 80MB 缓存。 12 核的锐龙 9 9900X3D 具有最高 5.5 GHz 频率,比 9900X 低 100 MHz。它包括 140MB 的总缓存,而非 X3D 型号为 76MB。两者的相同点是均为 120W TDP。 AMD 公司副总裁兼客户渠道业务总经理 David McAfee 此前已确认,Radeon RX 9000 系列显卡将于三月发售。 AMD RDNA 4 架构基于升级的 4nm 节点,搭载第二代生成式 AI 加速器、第三代光线追踪加速器和第二代 AMD Radiance 显示引擎。IT之家附目前传闻的 Radeon RX 9070 XT / 9070 显卡参数如下: 传闻参数 9070 XT 9070 PCIe 世代 5.0 5.0 流处理器数量 4096 3584 GPU 加速频率(MHz) 2970 2520 GPU 基准频率(MHz) 2400 2070 最大显存(GB) 16 16 显存位宽(Bit) 256 256 显存速度(Gbps) 20 20
不想漫无目的刷手机,这个应用比笨手机更有效
你为什么 要玩手机 先问一个问题,在点开这篇文章之前,你是为了什么而点亮手机屏幕的? 是回一个紧急的工作信息,还是刚刚在搜索引擎查完资料,抑或只是闲下来掏出手机随便刷刷? 根据有关数据,16 岁至 64 岁的网民平均每天网上冲浪时间为 6 小时 40 分钟,而中国移动互联网用户人均单日使用时长为 7 小时 15 分钟。 而这其中有不少时间,我们都是在无目的无意识地刷手机,被信息流所裹挟。 为了把自己从中解救,一名开发者打造了一个特别的应用。 关注爱范儿,发现下一个明日产品 让玩手机充满负罪感 不管是 iPhone,还是 Android 及其他手机,都基本标配了「屏幕使用时间」的系列功能,其中能通过屏幕变灰、锁定应用的方式,试图减少你的手机使用时间。 但至少对我来说,这些简单粗暴的阻挠,几乎没能对我造成太多的影响,想玩手机的时候还是会内心毫无波澜地点击几下关闭限制。 和完全「锁死」手机这种「物理方法」不同,作为第三方应用,Intenty 无法彻底阻止你打开手机和应用,而是巧妙地采用「心理战术」。 简单来说,Intenty 和它的名字一样,就是一个询问使用手机「意图」的应用。每当你解锁手机,Intenty 就会自动全屏弹窗,问出一个致命的问题: 你为什么要打开手机? 翻译:这个行为(玩手机)能提供什么价值? 当然,这个问题没有正确答案,不会因为你的答案不够「正当」,就锁死手机不让你进入,更多是唤起你内心对「玩手机」这件事的罪恶感,或者提醒自己要用手机干什么正事。 除了「意图」,这个 App 还提供了几个不同主题的问题类型:必要性、感知、动作、「极简」,同一个主题会有不同的具体问题,有时是需要手动输入答案的「简答题」,有时是提供答案选项的「选择题」。 如果你是属于及明明 DDL 近在眼前却还是放不下手机的拖延症晚期,「必要性」的问题会比较适合你: 你不能等个 30 分钟再玩手机吗? 这是你现在真正需要去做的事情吗? 玩手机你会有什么代价? ... 相信我,摸鱼的时候看到这些「灵魂发问」,真的会连回答都不想给出,直接按下熄屏按键继续手头上的事情了。 如果不愿直面这些「尖锐」的问题,Intenty 还提供了「感知」和「动作」两种比较特别的提示。 前者可能会让你描述一下周围的三个事物,或者让你深呼吸,动动脚趾头感受脚下的大地,总之就是靠从现实生活中提取「禅意」来对抗网瘾。 后者更加实际一点,就是让你在玩手机前做做伸展,检查下脖子和肩膀舒不舒服,眼睛酸不酸,玩手机也要注意保重身体。 最后一个「极简」只有三个选择题,问题就是「意图」和「必要性」的浓缩版: 科技是在服务你,还是你在服务科技? 你可以等到计划好的玩手机时间再玩吗? 现在手机对你来说是一个工具还是干扰? 如果还是不满意,可以修改或者自定义问题、选项,给自己手机里安排一个赛博「领导」或者「妈妈」。 在回答完问题后,Intenty 还会定时弹出通知,提醒用户使用手机也要「不忘初心」,记得自己是为什么用手机的。 翻译:你还在正轨上吗? 我更推荐「意图」和「必要性」两种提问更直击内心的主题,但其实 Intenty 这种有点烦人的机制,本身也稍微提高了玩手机的门槛,好几次成功劝退我玩手机的念头。 至于有时候,你只是想回一条微信,或者点播一首歌,Intenty 却问你「这会有什么代价」这种「严肃」的问题,其实也可以直接退出应用跳过问题,反正我们也不是用来开小差嘛。 Intenty 并不只是一个单纯的玩手机劝阻员,还会记录你的每一次解锁和相应的理由,一天下来,你就能一览无遗自己使用手机的目的和原因,及时做出调整。 不过目前 Intenty 只能选取一种风格的提问方式,对我来说,如果能够混合比较直接的「必要性」,以及精神性的「感知」,或许效果要好一点。 比起解锁手机,这种机制其实也很适合运用在具体的 App 中,毕竟很多时候,我们的注意力也只是被某几个社交媒体或者内容平台吸引,不过目前 Intenty 还做不到这点。 也因为弹窗机制的特殊性,Intenty 仅在 Android 平台推出。 如果是 iPhone 用户,Intenty 则推荐了一个名为 One-Sec 的类似应用,能够在你打开特定 App 时提示你累积的打开次数,并让你先进行深呼吸再继续使用。 传播戒网经验 从 2019 年开始,开发者 Yaroslav Neznaradko 就开始反思自己,是不是玩太多手机了? 我发现自己经常刷手机,看电子邮件、社交媒体、新闻资讯。我尝试了手机上的屏幕时间限制、焦点模式和应用程序拦截器,但它们相当令人沮丧,而不是有帮助。 为了减少这种「无目的」刷手机的行为,Neznaradko 决定在每次解锁手机之前,都自我反思一下用手机的意图,甚至专门用一个笔记本写下自己解锁手机的目的。 他发现,这种方式确实对减少无意识刷手机非常有效,因此在 2020 年开发了一个原型 App,功能还比较简单,单纯询问用户为什么要玩手机。 而在像 ChatGPT 这种聊天机器人兴起后,Neznaradko 把 App 改成「聊天界面」的形式,玩手机的原因将以对话框的方式发出。 旧版 Intenty 界面 但每解锁一次手机,都需要打字输入回答的方式,虽然有效提高了用户玩手机的门槛,但也很容易消磨用户的内心。 况且这个聊天界面的 UI,不仅和应用功能没啥关联,还会让用户想起吸引注意力的社交应用。因此这个新版的 Intenty,并未获得太多用户的青睐。 仔细研究了人机交互之后,Neznaradko 再次大改了 Intenty 的界面和功能,不仅更简洁美观,也好用了不少。 提问的界面变得非常简洁,白色打底,一行提问或者提示,没有太多的干扰元素吸引用户的注意力。 问题的种类也更多样化,回答起来更简单,也新增了「感知」「动作」这些让用户执行的小贴士。 可以说,这个应用有点像 Neznaradko 将自己的戒网小技巧,打包成一个好用的应用分享给有需要的人。 Intenty 官网也写道: Intenty 诞生于个人需求,并在我们的业余时间开发,是一个真正的、以用户为中心的项目,而不是一个专注于积累个人和使用信息的风险投资支持的初创公司。我们的目标不是收集您的数据或吸引您使用屏幕时间。 所以 Intenty 不仅免费下载,也看不到任何广告,基本都是本地运行,只需要通知、弹窗、后台三种权限,盈利方式只有一个月 1.99 美元(人民币 15 元不到)的会员,能开启不回答不放行的强效模式,以及定时开启、一键锁屏等进阶功能。 在相关的评论区和博客中,不少用户都对 Intenty 给予了正面评价,就连那些不太喜欢应用运作方式,或者应用无法正常在手机上运行的用户,也对 Neznaradko 的想法本身表示了赞同。 该死,这应用可太好了,帮助我质疑自己为什么要打开手机,即使我明明没有理由。 玩手机之前,问自己一个问题 对抗手机瘾,本质上是我们普通用户和应用背后的顶尖设计师、程序员、心理专家角力,试图从他们精心设计的注意力陷阱中抽身,因此不少人觉得戒手机困难,其实真的很正常。 所以我们会寻求一些外部的支持,除了上文提到的手机内置屏幕时间管理功能,我们也讨论过不能上网,或者只有极简网络功能的「笨手机」。 著名「笨手机」Light Phone III 这些方式和工具,都是用一种非常直接的方式,限制你的正常网络使用,也确实对不少人有效,但是 Intenty 的方式或许要更「无痛」一点。 Intenty 将自己定义为一个「赋权工具」:重新将智能手机的「掌控权」还给用户。 在我看来,Intenty 确实不是一个强制戒瘾的工具,更多是帮助自己重新整理、思考和手机之间的关系。 如果平时走在路上,即使没什么需要回复的消息,我也会想掏出手机来玩,这不仅没有必要,也十分危险。 而用上 Intenty 这几天,我伸手准备掏出手机时,内心已经抛出了一个 Intenty 式的疑问: 这是玩手机的最佳时机吗?这不能再等个 30 分钟吗? 答案显而易见,伸到裤兜的手也放了回去。 还有一个 Intenty 问题也带给我很深刻的印象: 这是你使用自己能量的最佳方式吗? 答案因人而异,至少对我自己来说,下班躺平打开手机看到这个问题之后,马上找出了很久没看的书、没举的哑铃,确实带来了一些刷手机之外的充实感。 使用 Intenty 的过程中,我不会有往常应用被限制之后那种要而不得从而抓耳挠腮的「戒断」感,因为在 Intenty 的引导下,是我自己决定不去打开那些上瘾的应用,或者干脆不用手机,有种生活和手机都被牢牢把握在自己手中的快感。 当然,Intenty 不是灵丹妙药,只是伸出一个援手,想要改变自己的生活,最终还是得靠自己。不管是屏幕使用时长功能,还是「笨手机」,抑或是那些能物理锁住手机的「自律神器」,皆是如此。 最后再分享 Intenty 中一个颇为「终极」的问题。或许这个应用不适合你,但这个问题很适合在使用电子产品的时候,稍微去思索一下: 是科技在服务你,还是你在服务科技? 文 | 苏伟鸿
DeepSeek狂飙13天:AI界开始真正严肃地思考未来
2025年1月中旬,英伟达CEO黄仁勋的中国之行备受瞩目。从北京到深圳,再到台中和上海,这位AI时代的“卖铲人”每到一处都掀起一阵热潮。然而,就在距离英伟达上海办公室仅200公里的杭州,一场足以撼动AI产业格局的风暴正在悄然酝酿。彼时,身家1200亿美元的黄仁勋或许并未意识到,一家名为深度求索(DeepSeek)的低调中国公司,即将在7天后成为英伟达的“黑天鹅”。 从1月20日推理模型DeepSeek-R1开源至今13天来,DeepSeek引起全球的惊讶,英伟达市值一周蒸发5520亿美元,硅谷巨头恐慌,华尔街焦虑。 图片来源:视觉中国 当所有人还在惊叹DeepSeek的惊人实力时,OpenAI终于坐不住了。当地时间1月31日,OpenAI正式推出了全新推理模型o3-mini,并首次向免费用户开放推理模型。这是OpenAI推理系列中最新、成本效益最高的模型,现在已经在ChatGPT和API中上线。OpenAI可能考虑开源、公开完整思维链。在o3mini正式推出之时,OpenAI的首席执行官‌‌Sam Altman(奥特曼)携一众高管在reddit回答网友问题,其间罕见承认OpenAI过去在开源方面一直站在“历史错误的一边”。Altman表示:“需要想出一个不同的开源策略”。 DeepSeek 的“闪电战”: 性能、价格与开源三重冲击 1月21日,特朗普在白宫宣布启动四年总投资5000亿美元、名为“星际之门”(Stargate)的AI基础设施计划。 前一天(1月20日),DeepSeek悄然开源了推理模型DeepSeek-R1。 随后,英伟达自己的科学家Jim Fan率先解读出了它的颠覆性意义。他说:“我们生活在这样一个时代:由非美国公司延续OpenAI最初的使命——做真正开放的前沿研究、为所有人赋能。” 然而,那一周全球的目光都聚焦在刚刚上任的特朗普身上。 但临近周末,DeepSeek突然成为科技圈、投资圈和媒体圈讨论的对象。摩根大通分析师Joshua Meyers说:“周五,我收到的问题95%都是围绕Deepseek的。” 有市场评论员预言,DeepSeek是“美国股市最大的威胁”。 但为时已晚,英伟达的跌势已经开始。1月24日(周五)英伟达股价跌去3.12%。1月27日(周一),英伟达遭遇17%的“历史性”大跌,市值蒸发近6000亿美元,黄仁勋的个人财富一夜之间缩水208亿美元。本周,英伟达累跌15.8%,市值蒸发5520亿美元。 DeepSeek-R1带来的最直接冲击来自三个方面:性能、价格和开源。 性能比肩 o1 1月24日(周五)发布的聊天机器人竞技场(Chatbot Area)榜单上,DeepSeek-R1综合排名第三,与OpenAI的ChatGPT o1并列。在高难度提示词、代码和数学等技术性极强的领域以及风格控制方面,DeepSeek-R1位列第一。 “白菜价”颠覆市场 DeepSeek-R1的价格低得惊人:API端口缓存命中1元/百万Tokens,缓存未命中4元/百万输入 tokens,输出16元/百万Tokens。仅为o1的2%~3%。 DeepSeek移动应用和网页端免费,而能力相当的 ChatGPT o1一个月200美元。 完全开源 DeepSeek-R1完全开源,任何人都可以自由地使用、修改、分发和商业化该模型,彻底打破了以往大型语言模型被少数公司垄断的局面,将AI技术交到了广大开发者和研究人员的手中。 1月24日,著名投资公司A16z的创始人马克·安德森发文称,Deepseek-R1是他见过的最令人惊叹、最令人印象深刻的突破之一,而且还是开源的,它是给世界的一份礼物。 最具煽动性的评价来自Scale AI创始人亚历山大·王(Alexandr Wang)。他说:过去十年来,美国可能一直在AI竞赛中领先于中国,但DeepSeek的AI大模型发布可能会“改变一切”。 华尔街的焦虑:DeepSeek动摇了 英伟达的“算力信仰”吗? 相比于技术,投资者更关心自己投资的公司将遭遇怎样的挑战。 他们开始思考,如果DeepSeek的低成本训练有效,是否意味着巨头们在算力上的投入不值得了。如果不需要疯狂投入,市场对英伟达的业绩预期还有支撑吗? 正如投行Jeffreies股票分析师Edison Lee团队1月27日在研报中所说,如今美国AI企业的管理层可能面临更大的压力。他们需要回答一个问题:进一步提高AI资本支出是否是合理的? 硅谷公司还面临着投资者的拷问。1月27日上午,高盛分析师Keita Umetani和多名投资者进行了谈话,不少投资者质疑:“如果没有回报,还能证明资本支出的合理吗?” 图片来源:视觉中国 随后,华尔街投行们纷纷发布报告安抚市场。 摩根大通分析师Joshua Meyers说,DeepSeek的(低成本)并不意味着扩张的终结,也不意味着不再需要更多的算力。 花旗分析师Atif Malik团队称,尽管DeepSeek的成就可能是开创性的,但如果没有使用先进的GPU对其进行微调和/或通过蒸馏技术构建最终模型所基于的底层大模型,DeepSeek的成就就不可能实现。 DeepSeek-R1的训练成本尚未公布。因此,一个月前(去年12月26日)发布的开源模型DeepSeek-V3成为主要分析对象。 DeepSeek-V3仅使用2048块英伟达H800 GPU,在短短两个月内训练完成。H800是英伟达特供中国市场的AI芯片,在性能上不及先进的H200、H100等。 官方声称的558万美元只是训练开销,真实总支出尚无定论。《DeepSeek-V3技术报告》中明确指出:请注意,上述成本仅包括 DeepSeek-V3的正式训练,不包括与架构、算法或数据相关的先前的研究或精简实验的成本。 “当部门里一个高管的薪资就超过训练整个DeepSeek-V3的成本,而且这样的高管还有数十位,他们该如何向高层交代?”Meta员工如是说。 DeepSeek训练成本低,一个重要原因是使用了数据蒸馏技术(Distillation)。数据蒸馏是将复杂模型的知识提炼到简单模型。通过已有的高质量模型来合成少量高质量数据,并作为新模型的训练数据。 根据技术报告,DeepSeek-V3利用DeepSeek-R1模型生成数据后,再使用专家模型来蒸馏生成最终的数据。 不过,数据蒸馏技术在行业内充满争议。南洋理工大学研究人员王汉卿向《每日经济新闻》记者表示,蒸馏技术存在一个巨大缺陷,就是被训练的模型(即“学生模型”)没法真正超越“教师模型”。OpenAI也把DeepSeek的蒸馏当作靶子加以攻击。 1月29日,OpenAI首席研究官Mark Chen发帖称,“外界对(DeepSeek的)成本优势的解读有些过头”。 不过,DeepSeek-V3的创新不仅于此。 资深业内人士向每经记者分析称,DeepSeek-V3创新性地同时使用了FP8、MLA(多头潜在注意力)和MoE(利用混合专家架构)三种技术。 相较于其他模型使用的MoE架构,DeepSeek-V3的更为精简有效,每次只需要占用很小比例的子集专家参数就可以完成计算。这一架构的更新是2024年1月DeepSeek团队提出的。 图片来源:arXiv MLA机制则是完全由DeepSeek团队自主提出、并最早作为核心机制引入了DeepSeek-V2模型上,极大地降低了缓存使用。 技术路线之争:DeepSeek 的“原创” 与 OpenAI 的“大力出奇迹” 2024年12月,清华大学计算机系长聘副教授、博士生导师喻纯在谈及中国AI发展时向《每日经济新闻》表示,中国在AI应用层有很大的优势,擅长“从1到10”,但原始创新能力(从0到1)还有待提高。 现在,这一看法可能不再适用了。 DeepSeek带来的最大“震撼”,是蹚出了一条与OpenAI截然不同的模型训练路径。 传统上,监督微调 (Supervised Fine-Tuning,简称 SFT)作为大模型训练的核心环节,需要先通过人工标注数据进行监督训练,再结合强化学习进行优化,这一范式曾被认为是 ChatGPT成功的关键技术路径。 但是,DeepSeek-R1-Zero是首个完全摒弃了SFT环节、而完全依赖强化学习(Reinforcement Learning,简称 RL)训练的大语言模型。DeepSeek-R1正是在R1-Zero的基础上进行了改进。 英伟达高级研究科学家Jim Fan用大白话解释说: SFT是人类生成数据,机器学习; RL是机器生成数据,机器学习。 这一突破为AI的自主学习范式提供了重要的实践范例。 DeepSeek为何不走捷径,而是寻求一条与OpenAI完全不同技术路线?背后的理由可以从创始人梁文锋的理想中探寻。 《每日经济新闻》记者了解到,DeepSeek规定员工不能对外接受采访。即便是DeepSeek用户群里的客服工作人员在解答群友疑问时也是小心翼翼,惜字如金。 寻找梁文锋的人更是踏破铁鞋。外界对他的了解大多来自于2023年5月和2024年7月《暗涌》对他的专访。专访文章将他称为“一个更极致的中国技术理想主义者”。和OpenAI创始人山姆·阿尔特曼(Sam Altman)一样,梁文锋的“目的地”是通用人工智能(AGI)。然而,梁文锋的理想不在于目的地,而是如何通往目的地。 DeepSeek选择“不做垂类和应用,而是做研究,做探索”“做最难的事”“解决世界上最难的问题”。 梁文锋口中的“难”,就是“原创”二字。 他说:“我们经常说中国AI和美国有一两年差距,但真实的gap是原创和模仿之差。如果这个不改变,中国永远只能是追随者,所以有些探索也是逃不掉的。” 对于选择和OpenAI不一样的路,梁文锋的口气中充满乐观:ChatGPT诞生在OpenAI“也有历史的偶然性”“OpenAI也不是神,不可能一直冲在前面”。 当地时间周一(1月27日)晚间,OpenAI首席执行官山姆·阿尔特曼终于对DeepSeek给出了他的评价。他在社交平台X上连发三条值得玩味的帖子。 首先,他重申了自己的目标——AGI。甚至比梁文锋更进一步,要“超越”AGI。 其次,他捍卫了自己的“路线”——算力不仅重要,而且前所未有地重要。 最后,他将DeepSeek-R1称作“一位新对手”,并表示“我们当然会推出更好的模型”。 当地时间1月31日,在携一众高管在reddit上举行AMA(问我任何问题)活动时,阿尔特曼正式承认DeepSeek是一个非常好的模型,OpenAI会制作出更好的模型,但领先优势会比以前减弱。 这是否是山姆·阿尔特曼向DeepSeek下的“宣战书”?他想较量的不仅关于谁是“更好的模型”,更是想用“大力出奇迹”的技术与“聪明”的技术进行一场比拼。 产业生态的博弈: 微软、英伟达、AWS纷纷接入 一边是硅谷、华尔街都在激辩DeepSeek的影响;另一边,科技巨头已经下场无缝连接DeepSeek-R1模型服务。 先是微软,当地时间1月29日,将DeepSeek-R1模型添加到其Azure AI Foundry,开发者可以用新模型进行测试和构建基于云的应用程序和服务。 1月29日的第四季度业绩电话会上,微软首席CEO萨提亚·纳德拉(Satya Nadella)再次肯定了DeepSeek“确实有一些真正的创新”,并且宣布DeepSeek-R1已可通过微软的AI平台Azure AI Foundry和GitHub获取,并将很快在微软AI电脑Copilot+ PC上运行。 虽然微软是OpenAI的深度投资者且有很多合作,但在产品商业化上它依然选择多样性的模型。目前Azure的平台上既有OpenAI的GPT系列、Meta的Llama系列、Mistral的模型,现在新增了DeepSeek。 紧接着,AWS(亚马逊云科技)也宣布,用户可以在Amazon Bedrock和Amazon SageMaker AI两大AI服务平台上部署DeepSeek-R1模型。 再然后是英伟达于当地时间1月31日官宣,DeepSeek-R1模型已作为NVIDIA NIM微服务预览版,在英伟达面向开发者的网站上发布。 英伟达还在官网中表示,DeepSeek-R1是一个具有最先进推理能力的开放模型。DeepSeek-R1等推理模型不会提供直接响应,而是对查询进行多次推理,采用思路链、共识和搜索方法来生成最佳答案。此前,1月28日,英伟达(中国)在对每经记者的回应中说到:“推理过程需要大量英伟达GPU和高性能网络。” 想要在AI算力领域挑战英伟达的AMD也毫不犹豫为DeepSeek“站台”。1月25日,AMD宣布,DeepSeek-V3模型已集成至AMD InstinctGPU上,并借助SGLang进行了性能优化。此次集成将助力加速前沿AI应用与体验的开发。 阿斯麦总裁兼CEO富凯1月29日表示:“任何降低成本的事情,对阿斯麦来说都是好消息”,因为更低的成本意味着更多的应用场景,更多应用意味着更多芯片。 DeepSeek冲击波的深远影响: AI的未来,何去何从? 2020年1月,OpenAI发表论文《神经语言模型的规模法则》(Scaling Laws for Neural Language Models)。规模法则表明,通过增加模型规模、数据量和计算资源,可以显著提升模型性能。在AI领域,规模法则被俗称为“大力出奇迹”,也是OpenAI的制胜法宝。 2024年底,AI界传出大模型进化遭遇“数据墙”的消息。美国技术研究公司Epoch AI预测,互联网上可用的高质量文本数据可能会在2028年耗尽。图灵奖得主杨立昆(Yann LeCun)和OpenAI前首席科学家伊利亚•苏茨克维(Ilya Sutskever)等人直言,规模法则(Scaling Law)已触及天花板。 “大力出奇迹”的忠实拥趸——硅谷巨头们开始将千亿美元级的资本投入算力。 这场“算力竞赛”的疯狂程度从下面这些数据中可见一斑。 图片来源:每经制图 但是,DeepLearning创始人吴恩达1月29日撰文提醒称,扩大规模(Scaling up)并非是实现AI进步的唯一途径。一直以来……人们过度关注扩大规模,而没有以更细致入微的视角,充分重视实现进步的多种不同方式。但算法创新正使训练成本大幅下降。 DeepSeek-R1开源至今已经过去13天,关于它的讨论还在继续。 DeepSeek的出现让人们开始重新审视开源的价值和风险,以及AI产业的竞争格局。这场由DeepSeek引发的“冲击波”,将对全球AI产业产生深远的影响。 未来的AI世界,是“大力出奇迹”的继续狂飙,还是“聪明”技术的异军突起?是巨头垄断的固化,还是百花齐放的繁荣? DeepSeek出现,让AI界开始真正严肃地思考未来:是继续烧钱豪赌,还是让AI成果商业化、平民化和普惠化? 随着训练成本降低、技术成熟以及开源,大语言模型将愈发成为一种普通产品。 1月31日,Hugging Face联合创始人兼CEO托马斯・沃尔夫(Thomas Wolf)说:“我认为人们正在从对模型的狂热中冷静下来,因为他们明白,得益于开源……很多这类模型将会免费且可自由获取。” 巧合地是,同日,OpenAI正式推出了全新推理模型o3-mini,并首次向免费用户开放推理模型。这是OpenAI推理系列中最新、成本效益最高的模型,现在已经在ChatGPT和API中上线。在o3mini正式推出之时,Sam Altman携一众高管在reddit回答网友问题时,罕见承认OpenAI过去在开源方面一直站在“历史错误的一边”。Altman表示:“需要想出一个不同的开源策略”。

版权所有 (C) 广州智会云科技发展有限公司 粤ICP备20006386号

免责声明:本网站部分内容由用户自行上传,如权利人发现存在误传其作品情形,请及时与本站联系。