——带宽才是硬通货 · 同价位对照 · "破解"的真相 · MoE 让老卡复活 · 预算决策表
九月初,闲鱼挂出一块英伟达 DRIVE Orin-X(TA990SA),标价 1569 元,上架不久一万多人浏览。它原本是蔚来、理想的智驾核心部件,整车厂采购一颗要三百多美元;2025 年英伟达推出算力 2000 TOPS 以上的 Thor 后老款淘汰,泡水车、事故车零件流入二手市场。32GB 统一内存能跑本地大模型,于是它被当成"便宜的 32G 显卡"卖。
一、32G 显存为什么只跑出 8 个字
它采用 32GB LPDDR5 统一内存、256-bit 位宽,理论峰值带宽 204.8 GB/s,实际可持续带宽通常只有峰值的 75%–80%,约 155–163 GB/s。实测跑 Qwen-27B INT4,每秒只输出 8–11 个字;喂入 2000 字上下文,等第一个字要 3 秒左右。问题不在容量,在带宽。
二、一条公式解释所有二手卡
单并发生成时,每吐一个 token,GPU 都要把权重从显存完整读一遍,因此:
生成速度(token/s)≈ 有效显存带宽(GB/s)÷ 权重体积(GB)
代入 Orin-X:Qwen-27B INT4 权重约 16GB,16 ÷ 0.16 ≈ 9.7 token/s,与实测 8–11 完全吻合——它没有翻车,只是跑到了自己带宽的上限。卖家所有宣传语都在讲"32G 显存",因为容量直观好比较;真正决定体验的带宽,买家不会问、卖家也从不提。
三、同价位的降维打击:AMD MI50 32G
同样 1500–2000 元预算,二手市场能买到原生企业级加速卡 AMD MI50 32GB。架构确实老(Vega 20),但它用 1TB/s 的 HBM2 压制 204.8 GB/s 的 LPDDR5:同样跑 Qwen-27B INT4,实测 35–45 token/s,约 4–5 倍差距。坑也要说清:需搭配 x86 主板,市场混有 16G 版本冒充 32G,买前务必核对实物。
四、性价比天花板:CMP 170HX"破解"的真相
CMP 170HX 基于 GA100 核心(A100 同门),出厂自带 64G HBM2e,矿厂为省成本用固件把它锁到 8G 往外卖,所以 nvidia-smi 里只认 8G。"破解"的本质是解锁,不是扩容——颗粒本来就焊在板上。解锁后实测带宽 1600 GB/s(约为 4090 的 1.6 倍),单卡可装下 45.85 GiB 的 Qwen3-Next-80B-A3B AWQ-4bit 并跑到 decode 110 token/s;整机为一张卡几百元加 X99 双路平台约 1300 元。代价是:不是即插即用,没有视频输出,PCIe 被熔丝锁在 x4,功耗锁 300W。
五、稳妥路线与真正的变量
5090 上市后,二手 4090 跌到 1200–1500 美元(约 4500 元),24GB 显存能舒服跑遍甜点位模型:Qwen3-30B Q4_K_M 约 25 token/s,Mistral Small 3 Q5_K_M 约 42 token/s。更大的变量在模型侧:MoE 只挑选少数专家参与计算,可把路由与注意力留在显存、专家权重卸载到内存,性能不会断崖下跌——RTX 3080 Ti 配 llama.cpp 的 CPU-MoE 卸载跑 Qwen3.6-35B-A3B 能到 25 token/s 以上,十年前的 GTX 1080 跑 Gemma-4-26B-A4B 也有 14+ token/s。
六、按预算决策速查表
| 你的处境 | 选什么 | 参考价 |
|---|---|---|
| 只想试水,跑 7B 级 | 二手 RTX 3060 12GB(显存优先于速度) | ¥1100–1400 |
| 要 32G 跑 27B/32B,不想折腾 | AMD MI50 32G(务必确认真是 32G) | ¥1500–2000 |
| 能折腾,想极低成本跑 70B–80B | CMP 170HX 解锁(64G HBM2e)+ X99 平台 | 整机 ¥1300 起 |
| 省心长期用,或手上有老显卡 | 二手 RTX 4090 24G;老卡则直接上 MoE + llama.cpp | 约 ¥4500/¥0 |
小结
今天搭一套够用的本地大模型环境,已经不需要几万块。前提是看懂一件事:显存容量决定你能不能跑,显存带宽决定你愿不愿意用。Orin-X 那 1569 元买到的不是"便宜的 32G 显卡",而是一堂关于带宽的公开课。
说明:本文数据来自 2026 年 9 月公开的硬件评测与二手市场行情,部分为第三方玩家实测结果;二手价格波动较快,购买前请以实时行情与实物核验为准。本文不构成购买建议。
评论已关闭