RTX 3090 跑大模型实测:24GB 显存能撑到哪一步
AIAI Summary (BLUF)
RTX 3090 拥有 24GB GDDR6X 显存和 936 GB/s 带宽,目前闲鱼中位价约 8350 元。在 Q4 量化下,它最高能跑 32B 参数模型,预估速度 33 tokens/s。本文整理了完整规格、2026 年新模型的兼容性测试以及多平台价格参考。
核心洞察
3090 这张卡在 2026 年还能被单独拎出来做一页参考,说明 24GB 显存这个甜点位的生命周期比想象中长。有意思的是闲鱼中位价稳在八千多,而 eBay 上还有 82 条二手挂单在流通,供给端并没有枯竭。真正值得琢磨的是那张模型表:Q4 量化将模型参数从高精度(如32位浮点数)转换为低精度(如8位整数)的技术,以减少内存占用和加速计算,同时保持可接受的精度水平。下 27B 稠密模型只能塞 8K 上下文,这个限制比速度数字更影响实际体验。
核心结论
RTX 3090 配备 24GB GDDR6X一种高性能显存技术,由美光开发,提供比 GDDR6 更高的带宽,常用于高端显卡。 显存,带宽 936 GB/s,位宽 384-bit,基于 AmpereNVIDIA 的 GPU 架构,接替 Turing 架构,采用三星 8nm 工艺,引入第二代 RT 核心和第三代 Tensor 核心。 架构(GA102),BF16 算力 142.3,INT8 算力 284.7,不支持 FP8。
截至当前,闲鱼 RTX 3090 中位价为 ¥8,350,24 小时内上涨 2.08%;eBay 美国二手市场有 82 条挂单,Amazon.co.jp 日本新品有 11 条挂单。
在 4-bit 量化下,Qwen3.6 27B 和 Qwen3.8 27B 仅能支持 8K 上下文,速度为 37.8;而 Gemma 4 E4B 和 Qwen3.5 9B 在同等量化下可支持 128K 上下文。
单卡 RTX 3090 无法运行 70B 稠密模型:Q4_K_M 量化、8K 上下文下约需 43GB 显存,超出 24GB 上限。
在 2-bit 量化下,50B 以内所有列出模型均可装载;MoE混合专家模型,一种稀疏激活的架构,通过动态选择专家子集提升模型效率。 模型(如 Gemma 4 26B A4B、GLM 4.7 Flash、Qwen3.6 35B A3B)在 8-bit 下需卸载至系统内存运行,速度按 70 GB/s 内存带宽估算。
GeForce RTX 3090NVIDIA 于 2020 年发布的旗舰消费级显卡,基于 Ampere 架构,拥有 24GB GDDR6X 显存,适合 AI 推理和中等规模模型训练。 完整规格
24GB GDDR6X,936 GB/s 带宽,384-bit 位宽。核心 10,496 个,张量核心 328 个,Ampere 架构(GA102)。BF16 算力 142.3,INT8 284.7,FP8 没有。CUDA英伟达开发的并行计算平台和编程模型,专门用于利用GPU进行通用计算加速。 生态。
| 项目 | 参数 |
|---|---|
| 类型 | 消费卡 |
| 功耗 | 350 W |
| 供电接口 | 12-pin(Founders Edition) |
| 槽位 | 3 |
| 长度 | 313 mm |
| 接口 | PCIe 4.0 x16 |
| 发布日期 | 2020年9月24日 |
| 官方定价 | ¥10,050 |
GeForce RTX 3090 能跑哪些模型?
只列 2026 年起发布、50B 以内的版本。
| 模型 | 2-bit 装得下 | 2-bit 速度 | 2-bit 上下文 | 4-bit 装得下 | 4-bit 速度 | 4-bit 上下文 | 8-bit 装得下 | 8-bit 速度 | 8-bit 上下文 |
|---|---|---|---|---|---|---|---|---|---|
| Gemma 4 E4B | 是 | 168.4 | 128K | 是 | 121.1 | 128K | 是 | 70.2 | 128K |
| Qwen3.5 9B | 是 | 139.7 | 128K | 是 | 100.4 | 128K | 是 | 58.2 | 32K |
| Gemma 4 12B | 是 | 99.8 | 32K | 是 | 74.1 | 32K | 是 | 44.6 | 8K |
| Gemma 4 26B A4B | 是 | 129 | 32K | 是 | 112.2 | 32K | 卸载 | 24.4 | 无 |
| Qwen3.6 27B | 是 | 54.2 | 32K | 是 | 37.8 | 8K | 否 | 无 | 无 |
| Qwen3.8 27B | 是 | 54.2 | 32K | 是 | 37.8 | 8K | 否 | 无 | 无 |
| GLM 4.7 Flash | 是 | 165.2 | 128K | 是 | 144.4 | 32K | 卸载 | 22.1 | 无 |
| Gemma 4 31B | 是 | 40.6 | 8K | 否 | 无 | 无 | 否 | 无 | 无 |
| Qwen3.6 35B A3B | 是 | 160.9 | 32K | 是 | 141.1 | 32K | 卸载 | 32.7 | 无 |
判定口径:权重加 KV cacheKey-Value cache that stores intermediate computations during transformer model inference, significantly reducing redundant computations for repeated tokens and improving inference efficiency. 加运行开销,总和不超过可用显存,单卡。MoE 模型标「卸载」的意思是,把专家权重放进系统内存后能跑,显存只放注意力层和 KV cache,速度按内存带宽 70 GB/s 估算。上下文列给的是能装下的最大档位。
价格
当前闲鱼中位价 ¥8,350,24 小时涨了 2.08%。价格每 6 小时更新一次。
其他市场:eBay 美国二手有 82 条挂单;Amazon.co.jp 日本新品有 11 条挂单,目前沿用上次报价。
购买链接可能含联盟标记,不影响你支付的价格。
常见问题
GeForce RTX 3090 有多大显存?
24GB GDDR6X,带宽 936 GB/s。
GeForce RTX 3090 能跑 70B 模型吗?
单卡跑不了。Q4_K_M 量化、8K 上下文下,70B 稠密模型大约需要 43GB,超过 24GB 显存。
GeForce RTX 3090 多少钱?
当前闲鱼中位价 ¥8,350。取自平台挂单价的中位数,每 6 小时更新。
常见问题(FAQ)
RTX 3090 24GB 显存能跑 32B 模型吗?
可以。在 Q4 量化下,RTX 3090 最高能跑 32B 参数模型,预估速度 33 tokens/s。但需注意上下文限制,例如 27B 稠密模型在 Q4 下只能塞 8K 上下文,实际体验受影响。
RTX 3090 现在二手价格多少?
当前闲鱼中位价约 ¥8,350,24 小时涨了 2.08%。eBay 美国二手有 82 条挂单,Amazon.co.jp 日本新品有 11 条挂单。价格每 6 小时更新一次。
RTX 3090 能跑 70B 大模型吗?
单卡跑不了。Q4_K_M 量化、8K 上下文下,70B 稠密模型大约需要 43GB 显存,超过 RTX 3090 的 24GB。需要多卡或更大显存的专业卡。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



