# 8GB显存就够，Strata 让普通电脑也能运行千亿参数大模型

**URL:** <https://meta.appinn.net/t/topic/93257>\
**Category:** 青蛙的应用\
**Created:** [2026 年10 月 10 日 08:44 UTC](https://meta.appinn.net/t/topic/93257 "2026-10-10T08:44:17Z")\
**Posts on this page:** 11\
**Page:** 1

<div class="post-metadata">

**Author:** ![Qingwa](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/qingwa/32/58632_2.png) [@Qingwa](https://meta.appinn.net/u/Qingwa)\
**Post date:** [2026 年10 月 10 日 08:44 UTC](https://meta.appinn.net/t/topic/93257/1 "2026-10-10T08:44:17Z")

</div>

原始链接在： [8GB显存就够，Strata 让普通电脑也能运行千亿参数大模型 - 小众软件](https://www.appinn.com/strata/)

青小蛙帮你们试过了，可行！

  
 ![](https://h2cdn.appinn.me/original/3X/4/f/4f3a0b4b57844a2db36ad67611adf2731a2e15dd.jpeg)

RTX 5070、RTX 3060、RTX 4060 Ti、RX 9070 XT、RX 9060 XT、RX 7800 XT、RTX 3090，甚至多年前的 Quadro RTX 4000 和 TITAN RTX…

以上这些常见的显卡，只要有 8GB 显存、16GB 内存，一台普通电脑，就有机会在本地运行拥有 1250 亿参数的大模型 **Qwen3.8-Flash-Next** 。

这就是最近几天，开源项目 **Strata** 带来的震撼：[https://github.com/Niko1221/Strata](https://github.com/Niko1221/Strata)

 ![](https://h2cdn.appinn.me/original/3X/0/e/0e26219865bf7ab11dc94d975b56d6daa1642776.avif)

甚至，青小蛙觉得，这可能是普通人，第一次能够在普通电脑上，以如此低的硬件门槛，运行一个真正「能用起来」的千亿参数大模型。

## 8GB 显存，究竟能运行多强的大模型？

Qwen3.8-Flash-Next，这是2026年8月发布的开源模型，1250 亿参数，在部分编程和推理测试中，成绩已经超过 Claude Opus 4.6。

不过，8GB 显存显然无法运行完整的 Qwen3.8-Flash-Next，即使经过压缩，模型仍然需要几十 GB 的存储空间。

Strata 巧妙的将模型的一部分放到系统内存之中，甚至还有一部分放到 SSD 中，这样显卡内存的需求量就没那么大了。

于是普通电脑才有了机会。

（注意，不要使用机械硬盘，青小蛙试过了，太慢，慢死）

Strata 的用户反馈了非常多的测试结果：

| 显存 | 显卡型号 | 系统内存 | 模型版本 | 生成速度 |
| --- | --- | --- | --- | --- |
| **8GB** | RTX 4060 Ti | 32GB | Coder IQ1\_M | **19～21 tok/s** |
| **8GB × 2** | Quadro RTX 4000 × 2 | 96GB | Swift IQ2\_XS | 18～23 tok/s |
| **12GB** | RTX 3060 | 64GB | IQ3\_XXS | 30 tok/s |
| **12GB** | RTX 5070 | 64GB | Q2\_0 | **94 tok/s** |
| **12GB** | RTX 5070 | 64GB | IQ3\_S | 53 tok/s |
| **16GB** | RX 7800 XT | 约 121GiB | Coder IQ1\_M | 38～44 tok/s |
| **16GB** | RX 9060 XT | 64GiB | Coder IQ1\_M | 27.1 tok/s |
| **16GB** | RX 9070 XT | 47GB | Q2\_0 | 60 tok/s |
| **16GB** | RTX 4060 Ti | 96GB DDR3 | Q2\_0 | 48.1～55.8 tok/s |
| **16GB** | RTX 4060 Ti | 96GB DDR3 | IQ3\_S | 30.5～35.1 tok/s |
| **24GB** | RTX 3090 | 64GB | IQ3\_XXS | 50～60 tok/s |
| **24GB** | RTX 3090 | 64GB DDR4 | IQ3\_S | **60～77.9 tok/s** |
| **24GB × 2** | TITAN RTX × 2 | 125GiB | IQ3\_S | 70.9～77.3 tok/s |

在本地运行大模型，最重要的体验就是生成速度了，青小蛙觉得能达到40tok/s就可以用了，60tok/s以上则非常流畅。

## 但是！

Strata 虽然对显卡要求不高，但是对内存要求极高。

三个门槛：

1. **32GB 内存：入门级** 。适合运行经过大幅压缩的 Coder 等精简模型，需要牺牲部分模型能力。
2. **48GB 内存：进阶级** 。可以尝试 Q2\_0、IQ2\_XS 等低精度量化版本，保留完整的专家结构。
3. **64GB 内存：推荐级** 。可以运行 IQ3\_XXS、IQ3\_S 等更高精度的量化版本，更适合日常使用。
4. **96GB 内存：高配级** 。可以尝试 IQ4 等更高精度的模型，进一步减少量化带来的能力损失。

而需要360GB显存的原始 Qwen3.8-Flash-Next 模型，在部分编程测试中已经超过 DeepSeek-V4-Flash，甚至在部分项目中领先 Claude Opus 4.6。

虽然没办法直接比较模型能力，青小蛙觉得入门级的 Strata 也足够一般家庭的大模型使用了，比如跑个龙虾在家运行小任务、智能家居、智能问答、处理文档、识别图片等等，甚至就帮你安装、维护 Linux 这一项，就很赞啊。

最重要的是，只需要电费，完全不需要任何 API 费用，并且不限量。

推荐给有显卡的各位试试。

* * *

## N卡的都在跑 Strata，我们 AMD 试试 gufo

是的了，AMD 也有自己的 Strata：[https://github.com/gufo-org/gufo](https://github.com/gufo-org/gufo)

 ![](https://h2cdn.appinn.me/original/3X/4/4/44d662048d4b720dbbd506d4b690804868f63db5.avif)
* * *

原文：https://www.appinn.com/strata/

---

<div class="post-metadata">

**Author:** ![TecNico](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/tecnico/32/78882_2.png) [@TecNico](https://meta.appinn.net/u/TecNico)\
**Post date:** [2026 年10 月 10 日 09:02 UTC](https://meta.appinn.net/t/topic/93257/2 "2026-10-10T09:02:01Z")

</div>

虽然Qwen4架构很好，但是内存也很贵啊。早知道现在会这样，当初直接上128G内存多好。不跑仿真，不做视频，谁能想到居然真能用上128G内存啊！！！

---

<div class="post-metadata">

**Author:** ![Qingwa](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/qingwa/32/58632_2.png) [@Qingwa](https://meta.appinn.net/u/Qingwa)\
**Post date:** [2026 年10 月 10 日 09:02 UTC](https://meta.appinn.net/t/topic/93257/3 "2026-10-10T09:02:22Z")

</div>

哎，我现在卡在40…

---

<div class="post-metadata">

**Author:** ![Kaiyuan](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/kaiyuan/32/18103_2.png) [@Kaiyuan](https://meta.appinn.net/u/Kaiyuan)\
**Post date:** [2026 年10 月 10 日 09:08 UTC](https://meta.appinn.net/t/topic/93257/4 "2026-10-10T09:08:16Z")

</div>

我3070TI，56G内存，之前跑逃逸版QWEN，我自己能接受速度。

---

<div class="post-metadata">

**Author:** ![Qingwa](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/qingwa/32/58632_2.png) [@Qingwa](https://meta.appinn.net/u/Qingwa)\
**Post date:** [2026 年10 月 10 日 09:08 UTC](https://meta.appinn.net/t/topic/93257/5 "2026-10-10T09:08:36Z")

</div>

哇，那快试试这个

---

<div class="post-metadata">

**Author:** ![Xenon](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/xenon/32/63063_2.png) [@Xenon](https://meta.appinn.net/u/Xenon)\
**Post date:** [2026 年10 月 10 日 09:15 UTC](https://meta.appinn.net/t/topic/93257/6 "2026-10-10T09:15:49Z")

</div>

哎好想买内存啊 :sob:

---

<div class="post-metadata">

**Author:** ![SmallPackage](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/smallpackage/32/57958_2.png) [@SmallPackage](https://meta.appinn.net/u/SmallPackage)\
**Post date:** [2026 年10 月 10 日 09:16 UTC](https://meta.appinn.net/t/topic/93257/7 "2026-10-10T09:16:37Z")

</div>

我当年买了96G的DDR5，准备整个服务器搞数据玩，但硬盘价格先起飞了，于是作罢了 :rofl:

但这96GB的低端DDR5内存在我手里条倒是涨了不少。之前还挂着想卖，都没人询价，纯纯有价无市。

---

<div class="post-metadata">

**Author:** ![TecNico](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/tecnico/32/78882_2.png) [@TecNico](https://meta.appinn.net/u/TecNico)\
**Post date:** [2026 年10 月 10 日 09:35 UTC](https://meta.appinn.net/t/topic/93257/8 "2026-10-10T09:35:25Z")

</div>

> [@Qingwa](#):
>
> 我现在卡在40

我现在只有64，显存只有8，放三年前看还可以，觉得至少战5年不成问题吧。没想到需求膨胀会这么快，两年过去就不行了。

---

<div class="post-metadata">

**Author:** ![SomeoneAtAppinn](https://meta-edge.appinn.com/letter_avatar_proxy/v4/letter/s/f9ae1b/32.png) [@SomeoneAtAppinn](https://meta.appinn.net/u/SomeoneAtAppinn)\
**Post date:** [2026 年10 月 10 日 09:35 UTC](https://meta.appinn.net/t/topic/93257/9 "2026-10-10T09:35:49Z")

</div>

我有个2070的笔记本，64G内存，就是AMD的CPU不稳定……  
有空试试，希望CPU不要掉链子

---

<div class="post-metadata">

**Author:** ![Qingwa](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/qingwa/32/58632_2.png) [@Qingwa](https://meta.appinn.net/u/Qingwa)\
**Post date:** [2026 年10 月 10 日 09:36 UTC](https://meta.appinn.net/t/topic/93257/10 "2026-10-10T09:36:27Z")

</div>

wow

你现在就去试，别等了。再等的话，可以运行 deepseek 4.1 了怎么办

---

<div class="post-metadata">

**Author:** ![tjsky](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/tjsky/32/31059_2.png) [@tjsky](https://meta.appinn.net/u/tjsky)\
**Post date:** [2026 年10 月 10 日 10:22 UTC](https://meta.appinn.net/t/topic/93257/11 "2026-10-10T10:22:18Z")

</div>

> [@Qingwa](#):
>
> 在本地运行大模型，最重要的体验就是生成速度了

如果用来编程，输入速度比输出速度更重要，因为编程agent用的时候，基本都是，输入300token/输出1个token的比例，有时候甚至会有400:1的比例。

 ![_20261010181923](https://h2cdn.appinn.me/original/3X/7/0/7036dd6e865e1225b12895fb610ce60560213d49.png)

而现在的单机架构下，受限制DDR5内存的带宽，模型输入速度很难超过2K，输出再快，输入时1秒只能灌进去1.5~2.5K的token。云端API那种1秒命中上万token的速度，都是分布式显存集群堆出来的。

所以编程多轮agent时，大部分时间是工具在等待模型消化输入，而不是工具在等模型完成输出。
