[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-detail:ZX20250207_64071195":3},{"code":4,"data":5},0,{"unicode":6,"title":7,"categoryId":8,"categoryName":9,"industryId":10,"industryName":11,"origin":12,"originAuthor":13,"originRemark":14,"originUrl":15,"pic":16,"content":17,"numRead":18,"numLike":4,"createTime":19,"hadFav":4,"hadLike":4,"status":4,"memberUnicode":20,"companyLogo":21,"companyName":22,"corporateVideoUrl":13,"collected":4,"corporate3dCover":23,"corporate3dUrl":23,"corporate3dId":23,"companyUnicode":24,"focusFlag":25,"exhibitionMainInfoVO":23},"ZX20250207_64071195","李飞飞团队50美元训练出DeepSeek R1？","1242381412612444162","行业动态","1245513623956107264","其它行业",1,"","http:\u002F\u002Ftech.ifeng.com\u002F","https:\u002F\u002Ftech.ifeng.com\u002Fc\u002F8glHY3OHLqI","https:\u002F\u002Fx0.ifengimg.com\u002Fres\u002F2025\u002F53386D3E6C9768D8C842D4D78C93C408314336F4_size167_w933_h539.png","\u003Cdiv class=\"index_articleBox_6mBbT\" style=\"height:auto\">\n \u003Cdiv class=\"index_text_D0U1y\">\n  \u003Cp>今天下午简直被这条新闻刷屏了，“震惊”“李飞飞”“50美元”“Deep Seek R1”，这几个词连到一起，简直是掀了 OpenAI 和英伟达的桌子，即便是蒸馏出来的模型，那这么低的成本，\u003Cstrong>OpenAI 花了几十、几百亿美元做出来的模型，被轻松复制，那 OpenAI 的估值不得打个骨折？\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>\u003Cimg class=\"empty_bg\" src=\"https:\u002F\u002Fx0.ifengimg.com\u002Fres\u002F2025\u002F53386D3E6C9768D8C842D4D78C93C408314336F4_size167_w933_h539.png\" src=\"data:image\u002Fpng;base64,iVBORw0KGgoAAAANSUhEUgAAAAEAAAABAQMAAAAl21bKAAAAA1BMVEXy8vJkA4prAAAACklEQVQI12NgAAAAAgAB4iG8MwAAAABJRU5ErkJggg==\" style=\" width: 640px; height: 369px;\">\u003C\u002Fp>\n  \u003Cp>我就赶紧看了下论文：\u003C\u002Fp>\n  \u003Cp>\u003Cimg class=\"empty_bg\" src=\"https:\u002F\u002Fx0.ifengimg.com\u002Fres\u002F2025\u002FC3A1B5A477C963F8A725C4655E37DB8697BFDEA2_size83_w1000_h425.png\" src=\"data:image\u002Fpng;base64,iVBORw0KGgoAAAANSUhEUgAAAAEAAAABAQMAAAAl21bKAAAAA1BMVEXy8vJkA4prAAAACklEQVQI12NgAAAAAgAB4iG8MwAAAABJRU5ErkJggg==\" style=\" width: 640px; height: 272px;\">\u003C\u002Fp>\n  \u003Cp>https:\u002F\u002Farxiv.org\u002Fhtml\u002F2501.19393v1\u003C\u002Fp>\n  \u003Cp>Github：https:\u002F\u002Fgithub.com\u002Fsimplescaling\u002Fs1\u003C\u002Fp>\n  \u003Cp>结果发现并不是那么回事。\u003C\u002Fp>\n  \u003Cp>首先这个 50 美元咋来的？因为\u003Cstrong>论文中提到用了 16 块 H100 GPU，而且只花了 26min，如果是租服务器的话，确实也就是几十美元。\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>\u003Cimg class=\"empty_bg\" src=\"https:\u002F\u002Fx0.ifengimg.com\u002Fres\u002F2025\u002F5658D62A030855D8BBFAB349E1FCFFD5D1064E46_size83_w1000_h136.png\" src=\"data:image\u002Fpng;base64,iVBORw0KGgoAAAANSUhEUgAAAAEAAAABAQMAAAAl21bKAAAAA1BMVEXy8vJkA4prAAAACklEQVQI12NgAAAAAgAB4iG8MwAAAABJRU5ErkJggg==\" style=\" width: 640px; height: 87px;\">\u003C\u002Fp>\n  \u003Cp>但问题是，论文中并不是训练出了 DeepSeek R1！\u003C\u002Fp>\n  \u003Cp>\u003Cstrong>论文的核心内容是基于开源的 Qwen2.5 - 32B 模型，\u003C\u002Fstrong>该模型是蒸馏出来的模型，32B 只能算是中等参数模型，作为本次实验对比的 R1 和 o1 都是大几千亿参数的模型。\u003Cstrong>用小数据集进行监督微调，而且微调后的参数数量跟之前基本保持一致，然后在特定任务上把性能优化了，而这些任务的性能表现可以媲美 DeepSeek R1 和 OpenAI o1。\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>怎么经过中文博主翻译过来后，就成了 50 美元蒸馏出了 DeepSeek R1?\u003C\u002Fp>\n  \u003Cp>以下是论文解读（使用豆包解读）：\u003C\u002Fp>\n  \u003Cp>\u003Cstrong>研究背景与目标：\u003C\u002Fstrong>语言模型性能提升多依赖训练时计算资源扩展，测试时缩放是新范式，OpenAI 的 o1 模型展示了其潜力，但方法未公开。本文旨在探寻实现测试时缩放和强推理性能的最简方法。\u003C\u002Fp>\n  \u003Cp>\u003Cstrong>s1K 数据集构建\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>初始数据收集：依据质量、难度和多样性原则，从 16 个来源收集 59029 个问题，涵盖现有数据集整理和新的定量推理数据集创建，用 Google Gemini Flash Thinking API 生成推理轨迹和解决方案，并进行去重和去污染处理。\u003C\u002Fp>\n  \u003Cp>最终样本选择：经质量、难度和多样性三步筛选得到 1000 个样本的 s1K 数据集。质量筛选去除 API 错误和低质量样本；难度筛选依据两个模型的性能和推理轨迹长度排除过易问题；多样性筛选按数学学科分类，从不同领域采样，且倾向选择推理轨迹长的样本。\u003C\u002Fp>\n  \u003Cp>\u003Cstrong>测试时缩放方法\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>方法分类与提出：将测试时缩放方法分为顺序和并行两类，重点研究顺序缩放。\u003Cstrong>提出预算强制（Budget forcing）方法，\u003C\u002Fstrong>\u003Cstrong>通过强制设定思考令牌的最大或最小数量，控制模型思考时间，引导模型检查答案、修正推理步骤。\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>基准对比：将预算强制与条件长度控制方法（令牌条件控制、步骤条件控制、类别条件控制）和拒绝采样进行对比。使用控制（Control）、缩放（Scaling）和性能（Performance）三个指标评估，结果表明预算强制在控制、缩放和最终性能上表现最佳。\u003C\u002Fp>\n  \u003Cp>\u003Cstrong>实验结果\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>实验设置：用 s1K 对 Qwen2.5-32B-Instruct 进行监督微调得到 s1-32B 模型，在 AIME24、MATH500 和 GPQA Diamond 三个推理基准上评估，并与 OpenAI o1 系列、DeepSeek r1 系列等模型对比。\u003C\u002Fp>\n  \u003Cp>性能表现：s1-32B 在测试时缩放中，性能随测试时计算资源增加而提升，\u003Cstrong>在 AIME24 上超过 o1-preview 达 27%，且是最具样本效率的开源数据推理模型，接近 Gemini 2.0 在 AIME24 上的性能，验证了蒸馏过程的有效性。\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>\u003Cstrong>消融实验\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>数据相关：\u003Cstrong>测试数据质量、多样性和难度组合的重要性。\u003C\u002Fstrong>随机选择（仅质量）、仅多样性选择、仅难度选择（选最长推理轨迹样本）的数据集性能均不如 s1K，训练 59K 全量样本虽性能强但资源消耗大，证明 s1K 构建方法的有效性。\u003C\u002Fp>\n  \u003Cp>测试时缩放方法：预算强制在 AIME24 测试中控制完美、缩放良好、得分最高，“Wait”作为扩展性能的字符串效果最佳。令牌条件控制在无预算强制时失败，步骤条件控制下模型可绕过计算约束，类别条件控制虽能提升性能但综合表现不如预算强制，拒绝采样呈现反向缩放趋势。\u003C\u002Fp>\n  \u003Cp>\u003Cstrong>讨论与展望\u003C\u002Fstrong>\u003C\u002Fp>\n  \u003Cp>样本高效推理：众多研究致力于复制 o1 性能，本文通过 1000 样本监督微调结合预算强制，构建出有竞争力的模型，推测预训练使模型具备推理能力，微调激活该能力。同时，介绍了相关基准和方法的发展情况。\u003C\u002Fp>\n  \u003Cp>测试时缩放：对比了并行和顺序测试时缩放方法，分析了预算强制的局限性，提出改进方向，如改进预算强制策略或结合强化学习探索新的测试时缩放方式 ，并指出并行缩放可作为突破顺序缩放限制的解决方案。\u003C\u002Fp>\n  \u003Cp>国内的网络环境真的是太浮躁了，这种信息，完全不确认一下就发出来误导大众，希望大家以后看到这种信息要多思考一下。\u003C\u002Fp>\n \u003C\u002Fdiv>\n \u003Cspan>\u003C\u002Fspan>\n \u003Cdiv class=\"index_end_1O-ki\">\u003C\u002Fdiv>\n\u003C\u002Fdiv>",234,"2025-02-08 11:54:42","3620375967","https:\u002F\u002Foss-images6396289.yzdli.com\u002F3620375967\u002F1ftirt8q0e\u002F20200602111616.png","广州立佳信科技有限责任公司",null,"ci67fdmkbnogt",-2]