# 国模的“蒸馏”之路还能走通吗

**URL:** <https://meta.appinn.net/t/topic/93086>\
**Category:** 讨论分享\
**Tags:** ai\
**Created:** [2026 年10 月 8 日 06:00 UTC](https://meta.appinn.net/t/topic/93086 "2026-10-08T06:00:58Z")\
**Posts on this page:** 11\
**Page:** 1

<div class="post-metadata">

**Author:** ![TacKana](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/tackana/32/67168_2.png) [@TacKana](https://meta.appinn.net/u/TacKana)\
**Post date:** [2026 年10 月 8 日 06:00 UTC](https://meta.appinn.net/t/topic/93086/1 "2026-10-08T06:00:59Z")

</div>

过去国模主要发力点都在减少计算的性能消耗上，这些工作的成效是显著的，国模api单价显著低于海外o/和a/模型的。

但是在绝对智能上始终落后与海外，过去蒸馏海外模型的对话数据让自家模型学习先进模型的思维链一直是国模在拿下价格优势后追赶智能差距的重要方式。

这是个很取巧的方式，在算力资源匮乏的情况下可以让国模以较小的代价保持与海外模型的智能差距在一个可以被大多数人接受的范围内，但是缺点也有，毕竟是蒸馏得到的内容如果使用中出现了数据没覆盖到的场景模型就会回到原有的水平，在国模大量使用的 MOE 架构的情况下就更容易出现神鬼二象性的情况了。

蒸馏可能导致模型出现泛化能力边界问题，蒸馏的数据集覆盖到了模型就聪明，没有覆盖到的时候就打回原形了。

过去一直有种说法是欧美负责开创新科技，中国负责追赶把科技的价格打下来，以现在的模型api单价趋势来看的确如此，但是在 AI 这里并非如此，百度是 AI 领域最早的一批玩家，当然大家都知道它的成分。黄埔军校嘛不说了。

国内的人才是不缺的，尤其是以 DeepSeek 代表的国模能通过优化架构、计算方式的场景下让模型价格大幅下降就能看出来。按照正常的情况来说国内的计算资源稀缺那么就会导致模型训练和推理成本上升，导致模型单价更贵，正常情况是比海外模型贵才是正常的。

但是现实情况是有限的资源下我们的模型价格还比海外便宜，这功归于国人扎实的技术优化能力，让国模的训练和推理成本远低于海外模型。

但是不管怎么优化物理限制是解决不了的，国模的训练规模一直受限于设备限制卡在一个临界点上，我和梁文峰先生的观点一致，国模和海外模型的核心差距主要就在算力规模上，因为算力规模限制没法像海外模型一样猛猛提升模型智力能力，只能把现阶段总心放在尽可能榨干现有算力基础和蒸馏海外模型的能力上。

不过这条路也不好走，海外模型已经开始反蒸馏了，而且模型开始隐藏思维链，蒸馏能拿到的数据只有问题、简化思维链、答案，拿不到原始的完整思维链就代表用这种数据蒸馏出来的模型是学习不到思维链的，只能得到答案。

国产芯片支棱起来啊:丿

* * *

“蒸馏”指通俗意义上的蒸馏，通过获取用户与高级模型的会话数据内容以训练新的模型让新的模型近似于拥有和高级模型类似的智能表现。

---

<div class="post-metadata">

**Author:** ![kivis](https://meta-edge.appinn.com/letter_avatar_proxy/v4/letter/k/6f9a4e/32.png) [@kivis](https://meta.appinn.net/u/kivis)\
**Post date:** [2026 年10 月 8 日 06:26 UTC](https://meta.appinn.net/t/topic/93086/2 "2026-10-08T06:26:14Z")

</div>

> 蒸馏数据没覆盖 → 打回原形

你对蒸馏的理解有需要补充的吗？

---

<div class="post-metadata">

**Author:** ![SmallPackage](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/smallpackage/32/57958_2.png) [@SmallPackage](https://meta.appinn.net/u/SmallPackage)\
**Post date:** [2026 年10 月 8 日 06:59 UTC](https://meta.appinn.net/t/topic/93086/3 "2026-10-08T06:59:34Z")

</div>

开口就是蒸馏只能说狗哨入脑太深了 :sweat_smile:

至于国内模型厂商，说真的，各种问题多的去了，很多甚至就是字面意义的来自于国内科技行业的“劣根性”，真要说，也不是一句两句就能说明白的。

但如果说来说去就变成了反复复读一个“蒸馏”，那只能说体现的就是互联网的效果了，本质就是用话题去占据你的心智了。

---

<div class="post-metadata">

**Author:** ![Colin5887](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/colin5887/32/59253_2.png) [@Colin5887](https://meta.appinn.net/u/Colin5887)\
**Post date:** [2026 年10 月 8 日 07:06 UTC](https://meta.appinn.net/t/topic/93086/4 "2026-10-08T07:06:18Z")

</div>

数据处理这边，向来是“Garbage in, garbage out”。没有好的语料，没有可能训练出高性能的模型。

至于好的语料…因为寒蝉效应以及一些没办法说的原因，预料质量在可预见的将来不会有改变

而你说的芯片…其实国内不缺算力，之前通过菲律宾洗下单地址，我们拿到了相当多的显卡，所以，有没有国产芯片都没有根本性的影响

---

<div class="post-metadata">

**Author:** ![SmallPackage](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/smallpackage/32/57958_2.png) [@SmallPackage](https://meta.appinn.net/u/SmallPackage)\
**Post date:** [2026 年10 月 8 日 07:26 UTC](https://meta.appinn.net/t/topic/93086/5 "2026-10-08T07:26:56Z")

</div>

真要说，国内不缺算力就要看是什么算力了，推理算力国内确实不缺，甚至看有人整理资料，国内实际上提供的推理算力是领先的。但训练算力其实还是很缺的。

---

<div class="post-metadata">

**Author:** ![Semidio](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/semidio/32/4037_2.png) [@Semidio](https://meta.appinn.net/u/Semidio)\
**Post date:** [2026 年10 月 8 日 07:54 UTC](https://meta.appinn.net/t/topic/93086/6 "2026-10-08T07:54:41Z")

</div>

建议先把构造SFT的行为给正名化，并且理解这种方法所能达成的效果和局限性了解清楚再来讨论，否则只会是鸡同鸭讲。

其次现在模型智力更多取决于特定知识信息的轮子转的有多快，世界知识需要靠爬虫和拆书扫描，Coding知识需要Agent的数据共享。

---

<div class="post-metadata">

**Author:** ![Huhu](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/huhu/32/20335_2.png) [@Huhu](https://meta.appinn.net/u/Huhu)\
**Post date:** [2026 年10 月 8 日 08:54 UTC](https://meta.appinn.net/t/topic/93086/7 "2026-10-08T08:54:44Z")

</div>

> [@SmallPackage](#):
>
> 开口就是蒸馏只能说狗哨入脑太深了

为这句话赞了！

---

<div class="post-metadata">

**Author:** ![Baiyssy](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/baiyssy/32/31041_2.png) [@Baiyssy](https://meta.appinn.net/u/Baiyssy)\
**Post date:** [2026 年10 月 8 日 15:12 UTC](https://meta.appinn.net/t/topic/93086/8 "2026-10-08T15:12:03Z")

</div>

欧洲负责基础理论，美国负责商品化，亚洲负责降成本。

这个路线现在没有以前那么清晰了，但是大体上还是不错的。

说起来，亚洲人，尤其是中国人还是穷惯了，所以对成本特别敏感，对风险也就特别敏感。

这种环境下你说要搞什么大的科学技术创新，还是难。

但是你说要搞管理创新，也就是搞人，还是容易的。

---

<div class="post-metadata">

**Author:** ![Dalieba](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/dalieba/32/3804_2.png) [@Dalieba](https://meta.appinn.net/u/Dalieba)\
**Post date:** [2026 年10 月 8 日 16:33 UTC](https://meta.appinn.net/t/topic/93086/9 "2026-10-08T16:33:29Z")

</div>

很有可能是过分依赖这招，玩的大了，人家的科技巨头也觉察到不对头，就筑起围栏反制了。

---

<div class="post-metadata">

**Author:** ![Huhu](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/huhu/32/20335_2.png) [@Huhu](https://meta.appinn.net/u/Huhu)\
**Post date:** [2026 年10 月 8 日 23:08 UTC](https://meta.appinn.net/t/topic/93086/10 "2026-10-08T23:08:15Z")

</div>

> [@Baiyssy](#):
>
> 欧洲负责基础理论

欧洲的理论在哪里？中国人在 AI 领域的论文数量又占多少？

没有论据，光说论点论证不了问题。

> [@Dalieba](#):
>
> 很有可能是这招玩的大了，人家的科技巨头也觉察到不对头

这是不问青红皂白，听了巨头的“诉状”直接先认下再说的。

* * *

1、它说是就是么？它说有就有么？西方说的常常是自己做的，这种例子还少么？莫不是又挖了自家教堂后院忙着给别人扣帽子；为什么它们一说，诸公便信了……西方的狗哨还真是好用呢。  
2、再说蒸馏，如果谁家蒸馏，谁家老板死，问：那几个西方“巨头”敢不敢接？蒸馏这事，那两家巨头之间都掰扯不清呢，却着急拿着污名化国内企业，这又是什么道理，什么目的？

---

<div class="post-metadata">

**Author:** ![moonlune](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/moonlune/32/6384_2.png) [@moonlune](https://meta.appinn.net/u/moonlune)\
**Post date:** [2026 年10 月 9 日 01:25 UTC](https://meta.appinn.net/t/topic/93086/11 "2026-10-09T01:25:18Z")

</div>

所谓蒸馏只是一部分原因，不是主要的原因，不要端不清主要问题。其次不要拿百度举例子，百度是公认的干啥啥不行！如果说谁先抢先收费，很可能包含百度，至于所谓的黄埔军校的说法，一个留不住人才的公司，就别往自己脸上贴金了！打个比方，贵公司招聘进来一批人，成长起来了，有点能力了，然后就跑了，就自我装潢成了黄埔军校么…
