KDZNR网

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 15|回复: 0

Linux 本地 AI 电脑选购:先挑驱动栈再挑机箱

[复制链接]
匿名
匿名  发表于 昨天 17:56 |阅读模式
NVIDIA 稳妥,AMD 要在支持清单里买,Strix Halo 需要新内核,Intel 是最便宜的 32 GB。选你愿意长期维护的那一套驱动栈。

本地 AI 真正重要的运行时——从 llama.cpp、Ollama 到 vLLM 和 ROCm 本身——都是先为 Linux 打包,再照顾其他系统。Linux 机器可以在没有桌面会话占用显存的情况下跑模型,还能同时驱动多块显卡,而 Windows 子系统一次只暴露一块。在软件这一侧,争论已经结束:这就是在家里跑模型最好的操作系统。



硬件这一侧则变得“驱动味”十足。Windows 买家选一个显存大小,任何带这个数的卡都能用。Linux 买家得先选驱动栈,因为栈决定了哪些卡是一等公民、发行版必须带哪个内核、以及这台机器会占用你多少个周末。NVIDIA 是稳妥路;AMD 在 ROCm 支持清单之内很好、清单之外要手动硬凑;Strix Halo 那枚 128 GB 迷你主机芯片,想要的内核比大多数长期支持版自带的还要新;Intel 是你能买到最便宜的 32 GB,只是裹在最厚的软件里。选你愿意维护的栈,机箱自然跟着定。本文是 Windows 篇的 Linux 姊妹篇,沿用同一套显存逻辑。

在 Linux 上,先选驱动栈,再选机箱

一个模型跑在三层你在别的系统上从不需要操心的东西上。内核得认识这块显卡:在 Linux 上,AMD 是树内的 amdgpu 驱动,Intel 是 i915/xe 驱动,NVIDIA 则是单独安装的模块。其上是运行时调用的计算库:NVIDIA 用 CUDA,AMD 用 ROCm,Intel 用 oneAPI,或者三家都能用的 Vulkan。再往上才是运行时本身——llama.cpp、Ollama,或内置其一的应用。

在 Windows 上,厂商把这些层藏在一个安装程序后面。在 Linux 上,每一层都是一个带版本号的决定,而买错往往就错在版本号上。一张新 Radeon 卡在两年前的内核上点不亮;一台 Strix Halo 机器内核不对,ROCm 只能看到它六分之一的显存;一张 Intel 卡没装厂商工具包,只能跑一半速度。这些,规格表上一个都看不出来。

所以老实的顺序是:先栈、再卡、最后机箱。总览就是一句话版的指南:三套栈,各自有内核下限、驱动、计算层和维护成本,共同站在一块 Vulkan 的地板上。

NVIDIA 是稳妥路,开源内核模块让它更省心

十年来,NVIDIA 在 Linux 上唯一的税就是私有驱动:一个二进制 blob,每次内核更新都要重编,发行版一升级就容易坏。这笔税基本没了。NVIDIA 的开源内核模块从 R560 驱动起成为默认安装,覆盖从 Turing 起的每张卡,性能官方称等效或更好,而在 Blackwell(也就是每张 RTX 50 系)上是强制使用。用户态的 CUDA 库仍然闭源,但过去最容易坏的那块——内核模块——现在开源了、由发行版打包。

安装就是一条命令。Ubuntu 的驱动指南建议桌面用 ubuntu-drivers install 命令、计算服务器加 --gpgpu 参数,推荐它是因为它装的是预先编译、已签名、能在 Secure Boot 下工作的模块。NVIDIA 的 CUDA 13.4 安装指南支持 Ubuntu 22.04、24.04、26.04,Debian 12、13,Fedora 44,以及 RHEL 8 到 10。Ubuntu 26.04 是第一个把 CUDA 收进自家仓库的版本,Arch 主仓也带上了 CUDA 13.4.1。如果你什么都不想碰,System76 的 Pop!_OS 为 GTX 16 系及更新的卡单独出了预装驱动的镜像。Ollama 的硬件页只要求驱动 550 或更新、计算能力 5.0,能回溯到很老的卡。

如今 NVIDIA 的坎不在软件,在显存价格。价格追踪站显示,32 GB 的 RTX 5090 街价约 6899.99 美元,比 1999 美元的指导价高出两倍多;16 GB 的 5070 Ti 要 1249.99 美元。二手市场跟着涨:一张 24 GB 的 RTX 3090——曾经被装机指南推荐为性价比之选——二手要约 1400 美元。NVIDIA 是低维护栈,但它不再是低价栈。

AMD 要在 ROCm 清单里买,那张清单就是导购

AMD 的计算平台曾经是 Linux AI 圈的笑柄。现在不是了,但它仍然是一张清单;为本地 AI 买 Radeon,意味着先读清单再看价格。AMD 的 ROCm 7.2.1 Radeon 支持矩阵点名了整条 RX 9000 系(9060、9060 XT、9070、9070 XT、9070 GRE)、RX 7000 的高端(7900 XTX、7900 XT、7900 GRE、7800 XT、7700、7700 XT)、PRO W7000 系列,以及 Radeon AI PRO R9600 和 R9700。RX 7600 和整个 RX 6000 代都不在上面。

哪些 Radeon 卡在 Linux 上能拿到 ROCm、由谁支持(列依次为:显卡|显存|ROCm 状态|街价):

Radeon AI PRO R9700|32 GB|AMD 自家 ROCm 清单|$1,700
RX 7900 XTX|24 GB|AMD 自家 ROCm 清单|$1,348 全新 · $900 二手
RX 9070 XT|16 GB|AMD 自家 ROCm 清单|$800
RX 7800 XT / 7700 XT|16 GB / 12 GB|AMD 自家 ROCm 清单|—
RX 9060 XT / 9060|16 GB / 8 GB|AMD 自家 ROCm 清单|—
Ryzen AI Max+ 395(Strix Halo)|最高 96 GB 共享|仅 Ollama 清单|—
RX 7600 XT / 7600|16 GB / 8 GB|仅 Ollama 清单|—
RX 6800 / 6800 XT / 6900 XT / 6950 XT|16 GB|仅 Ollama 清单|—
更老的卡或任何 6700 级|不定|Vulkan 或手动硬凑|—

两件事让这张清单没那么吓人。一是 Ollama 自带它自己的 ROCm 库,它的 Linux 清单比 AMD 的更长:加进了 RX 7600 和 7600 XT、RX 6800 到 6950 XT,以及 Ryzen AI Max+ 395。二是对两张清单之外的卡,有 HSA_OVERRIDE_GFX_VERSION 这个变量,让 ROCm 把你的芯片当成一颗相似的受支持芯片。llama.cpp 的构建文档注明它在 Linux 上有效、在 Windows 上无效——这正是整篇文章论点的一个小缩影:这个绕法只在这儿有。但它终究是个绕法。要买,就买 AMD 自家清单上的卡。

内核是 AMD 故事的另一半,因为驱动就在内核里。媒体评测 RX 9070 时要求 Linux 至少 6.12、最好 6.13,配 Mesa 25.0;而 Ubuntu 22.04 最新的硬件启用内核是 6.8。所以 RX 9000 的卡在 22.04 上就是一块镇纸,而同样的卡在 24.04 的 6.17 HWE 内核上、在 26.04 的 7.0 上、或在 Fedora 44 的 6.19 上都好好的。Ubuntu 26.04 的发行说明把 ROCm 7.1.0 收进了仓库,Arch 主仓带 rocm-hip-sdk 7.2.4,所以这两个系统上你可以完全跳过 AMD 的 amdgpu-install 包。无论哪种方式,把自己加进 render 和 video 用户组,否则运行时根本看不到 GPU。



读这张清单的回报是:你能买到唯二比 NVIDIA 便宜的 24 GB 和 32 GB 卡。RX 9070 XT 街价约 799.51 美元(指导价 599),24 GB 的 RX 7900 XTX 全新约 1348 美元、二手约 900 美元,32 GB 的 Radeon AI PRO R9700(一颗显存翻倍的 9070 XT)约 1699.99 美元,差不多是一张 5090 的四分之一。这些全都在 AMD 清单上。这就是 Linux 上 AMD 的买卖:显存更便宜,代价是花一个下午读清单。

Strix Halo 是 96 GB 那一档,它要的内核比多数 LTS 新

越过 32 GB,一台不上五位数显卡的 Linux 桌面,靠的就是 Windows 篇倚重的同一颗芯片:AMD 的 Ryzen AI Max+ 395,处理器和一颗 40 单元的 Radeon 8060S 共享最高 128 GB 焊死内存。在 Linux 上的差别在于你要怎么够到它。这里没有 Adrenalin 滑杆。AMD 的 RDNA 3.5 系统优化页建议把 BIOS 预留设小、约 0.5 GB,让内核的共享内存池去干活:GTT 池默认约为系统内存的一半,可用 AMD 的 amd-ttm 工具调大。在一台 128 GB 的机器上,你就能摸到和 Windows 一样的 96 GB 上限,而且怎么分由你说了算。

内核下限是最容易栽跟头的地方。在 6.16.9 内核修复落地之前,Strix Halo 上的 ROCm 只能看到内核已分配内存里的约 15.5 GB,机主们只能改启动参数绕行。AMD 的页面现在写明了硬性下限:Ubuntu 24.04 需要 HWE 6.17.0-19 或更新,它的 OEM 内核需要 6.14.0-1018 或更新,其他发行版需要 6.18.4 或更新,并点名 Fedora 43、Ubuntu 26.04 和 Arch 原生支持。Framework 自家的桌面 Linux 页宽松些,推荐 6.15 或更新、官方支持 Fedora 43、Ubuntu 25.10 和 Bazzite,但那个下限是让“这台机器当电脑用”的下限;AMD 的下限是让“GPU 看到全部显存”的下限。取高的那个。

各发行版的内核下限(针对两颗需要它的 AMD 芯片;列依次为:发行版|内核|RX 9000|Strix Halo):

Ubuntu 22.04.5(HWE)|6.8|太旧|太旧;ROCm 清单里仍支持 RX 7000,但跑不了 RX 9000 和 Strix Halo
Ubuntu 24.04.4(HWE)|6.17|仅最新 HWE|AMD 要求 HWE 6.17.0-19 或更新才能点亮 Strix Halo
Ubuntu 26.04 LTS|7.0|仓库自带 CUDA 和 ROCm|AMD 列为 Strix Halo 原生支持
Fedora 44|6.19|Framework 与 AMD 点名的 Strix Halo 发行版(Fedora 43 起)
Arch / CachyOS(滚动)|最新|主仓带 ROCm 7.2.4 和 CUDA 13.4;升级你自己负责

跨过这道坎,机器表现就和 Windows 的数字一致,而且一个 Linux 的怪癖对你有利。一项在 Strix Halo 迷你主机上的测试发现,llama.cpp 走 Vulkan 比 ROCm 生成还快:在一颗 30B 混合专家模型上,Vulkan 每秒 97.7 token,ROCm 73.7;而 ROCm 读提示词快 21%。所以即使在 AMD 原生路径上,聊天时也该先试厂商中立的后端。一颗稠密 70B 模型,预期就是 StorageReview 在 HP Z2 Mini G1a 上测到的速度:每秒 4.24 token;而 gpt-oss-120b 因为每个 token 只激活几十亿参数,能跑到接近每秒 40。

有三台机器用这颗芯片、且把 Linux 当一等公民。Framework Desktop 是社区最爱,它的配置页上 128 GB 型号 3449 美元、缺货中,64 GB 型号 1959 美元,自带系统不加钱。一颗 Ryzen AI Max+ Pro 495 的 192 GB 版本已公布,价格和上市时间未定。GMKtec 的 EVO-X2 标价 2199.99 美元(原价 2599.99),可选 Ubuntu 出货。HP 的 Z2 Mini G1a 通过了 Ubuntu 24.04 认证,评测机型约 3342.65 美元。无论哪台,都买 128 GB 配置:64 GB 的机器分给 GPU 的约 48 GB,装下 70B 就没有余量了。

Intel Arc 是性价比黑马:16 GB 的价买 32 GB,代价是软件税

Intel Arc Pro B70 是本篇最有意思的卡,也最能说明本文论点。它发布价 949 美元,带 32 GB GDDR6、608 GB/s 带宽、230 W 板卡,瞄准的就是本地推理而不是游戏。显存短缺把它推到了约 1300 美元,但仍是市面上最便宜的全新 32 GB 卡,大约一张 16 GB RTX 5070 Ti 的价,不到一张 5090 的五分之一。

税在栈上。Intel 的快速路是 SYCL,经它的 IPEX-LLM 项目到达;llama.cpp 快速上手要求装 oneAPI Base Toolkit 2025.0、建 conda 环境,每次跑之前还要先 source 一下那个 setvars.sh。B 系列指南还要加一个驱动 PPA,并坚持在固件里打开 Resizable BAR。媒体在 Ubuntu 26.04、内核 7.0、Mesa 26.0 下评测过 B70,这是个合理的信号:让这张卡舒服的就是这种发行版。漏了哪一样,你就退回 Vulkan,而在这儿这是实打实的速度损失:一项在 Qwen 3.6 27B、4-bit 下的测试里,SYCL 约每秒 22 token,Vulkan 约 14。NVIDIA 和 AMD 用户可以不管厂商工具包、只损失一点;Intel 用户不行。

交这笔税的回报,是现存通往 128 GB 独立显存最便宜的路。Puget Systems 在一台 Ubuntu 25.04 机器里塞了四张 B70,跑在 Intel 的 vLLM 容器下,四张合起来每秒 13.1 token 跑 Qwen 3.6 27B;8B 模型则随着加卡从每秒 35 token 翻倍到 70。按今天的价,四张卡约 5200 美元 GPU 成本,还不到一张 RTX 5090。这是个项目,不是一笔购物。

Vulkan 三家都能跑,代价是 10% 到 35%

上面一切都有兜底,而且是同一个兜底。Vulkan 是跨厂商图形接口,llama.cpp 用一个编译开关就能拿它做计算,Ollama 硬件页说这个后端在 Linux 上默认开启。它不需要工具包、不需要 PPA、不需要清单。它能跑在 ROCm 无视的 RX 6700 上、跑在没装 oneAPI 的 Intel 卡上、跑在 CUDA 装崩了的 NVIDIA 卡上。唯一要知道的是:Ollama 通过 Vulkan 读空闲显存做调度需要额外权限或 root,这是改一个 systemd 单元的事,不算拦路石。

生成速度:厂商自家后端对比 Vulkan,单位 token/秒(同一张卡、同一个模型;四项不同测试、四个不同模型,只在同一行内比,不要跨行比):

RTX 5090 · 7B 模型 Q4_0|CUDA 读提示词还快 36%|CUDA 290|Vulkan 264
Radeon RX 7900 级 · 稠密模型|ROCm 赢读提示词,Vulkan 赢生成|ROCm 47|Vulkan 49.4
Strix Halo 128 GB · Qwen3-Coder-30B MoE|同样分法:ROCm 读提示词快 21%、生成慢 25%|ROCm 73.7|Vulkan 97.7
Arc Pro B70 · Qwen 3.6 27B Q4_K_M|唯一一张必须走厂商路的卡|SYCL 22|Vulkan 14

这个代价可测量,而且比名声小。在 RTX 5090 上,一项对比里 CUDA 生成每秒 290 token、Vulkan 264,差 10%,而 CUDA 读提示词快 36%。同一页的 Radeon 数据里 Vulkan 生成略快于 ROCm、读提示词落后;上面 Strix Halo 测试也是这个分法;只有 Intel 卡拉开了大到足以影响购买决定的差距。规律一致:厂商路赢在读长提示词,Vulkan 写回复时不落下风;在 AMD 硬件上,Vulkan 是正经首选而非兜底。

在 Linux 上,你的模型到底跑在哪个后端(综合 Ollama 硬件页与 llama.cpp 构建文档;列依次为:GPU|Ollama|llama.cpp|CSuite):

NVIDIA GeForce / RTX PRO|CUDA(驱动 550+)|CUDA 或 Vulkan|Vulkan
AMD Radeon(在 ROCm 清单上)|ROCm|HIP 或 Vulkan|Vulkan
AMD Radeon(不在清单上)|Vulkan 或 HSA 硬凑|Vulkan 或 HSA 硬凑|Vulkan
Strix Halo Radeon 8060S|ROCm(在其 Linux 清单上)|HIP 或 Vulkan,Vulkan 生成更快|Vulkan
Intel Arc A / B / Pro|Vulkan,或 Intel 的 IPEX-LLM 构建|经 IPEX-LLM 走 SYCL,或 Vulkan|Vulkan

这张表里有一行要坦白讲。CSuite——本博客所属的桌面应用——内置 Ollama,而它的 Linux 版只带 Vulkan 后端:Linux 包里没有 CUDA 运行时,所以在那儿连 NVIDIA 卡都走 Vulkan,付出上面那 10% 的代价,而不是 CUDA。Linux 版以 AppImage 形式发布(自动更新)和一个 Debian 包(不自动更新)。想在 Linux 上走厂商路,就直接跑 Ollama 或 llama.cpp。

无头和多卡,是 Linux 甩开对手的地方

这是 Windows 和 Mac 桌面都给不了的部分。Ollama 的 Linux 安装注册了一个 systemd 服务,开机自启、崩溃自愈、用独立用户跑。用 sudo systemctl edit ollama 编辑它,设 OLLAMA_HOST=0.0.0.0,这台机器就能给你网络里每一台笔记本供模型。拔掉显示器它照跑。这把购买问题整个翻了过来:机器不再需要坐得舒服,它要安静、省电、塞满显存。

无头还能把显存还给模型。桌面会话本身就是一个 GPU 客户端:合成器、浏览器、每个 Electron 应用都占着配额;一篇分析 GPU 显存压力的文章测到,单个 Electron 应用关掉时释放约 300 MiB,GNOME 和 KDE 偏重,平铺窗口管理器“自己几乎不占”。一个不带桌面的服务器安装把整张卡交给模型,Ubuntu 的 --gpgpu 驱动参数就是为这种机器准备的。

多卡是另一项独占。微软的 WSL GPU 页写明,一台多 GPU 机器一次只能给 WSL 暴露一块。原生 Linux 全都暴露:llama.cpp 构建文档让你用 --device 参数挑设备、把一张模型拆到多卡上;vLLM 用张量并行做同样的事,Puget 就是这样把一个 27B 模型跑在四张 Intel 卡上。两张二手 RTX 3090 约 2800 美元凑出一个 48 GB 池子,够 4-bit 跑稠密 70B 模型——这是任何一万美元以下的单卡都装不下的。

两个提醒。两半显卡要过主板通信,所以一块带两条走线正确的全长插槽的板子,比处理器更重要,而几乎没有品牌整机带这种板子。两张 3090 满载就抽 700 W,还不算整机其余部分,意味着要 1000 W 电源和一个通风的机箱。如果一张 32 GB 卡就能覆盖你的野心,买它。

各显存档位能跑什么,谁又预装 Linux 卖给你

显存梯子本站每篇指南都一样,计算器能把你自己的模型愿望单映射上去。Linux 上变的是“厂商”那一列:谁愿意把那一档连同操作系统一起装好、带支持卖给你。

Linux 桌面的显存档位、以及谁预装 Linux 出售(与 Windows 篇同一套 4-bit 估法;列依次为:显存|4-bit 下能跑什么|Linux 路径|谁预装 Linux):

128 GB|120B MoE 读速可用;CUDA 下 200B 级|DGX Spark(Ubuntu 系 DGX OS),或四张 Arc Pro B70|NVIDIA 直销,或自组 Intel 工作台
96 GB|70B 稠密慢跑;120B MoE 读速|Strix Halo 128 GB 主机,内核 6.16.9+|Framework Desktop、GMKtec EVO-X2、HP Z2 Mini G1a
48 GB|4-bit 跑 70B 稠密,拆两卡|两张二手 RTX 3090 走 CUDA|自组;需两条全长插槽和 1000 W
32 GB|32B 稠密有余量;27B 长上下文|RTX 5090 · Radeon AI PRO R9700 · Arc Pro B70|Thelio Mira(5090)、Kymera 或自组
24 GB|27B 到 32B,偏紧|ROCm 上的 RX 7900 XTX,或二手 RTX 3090|Kymera Woodline;二手市场
16 GB|14B 长上下文;图像模型|RTX 5070 Ti · RX 9070 XT|Thelio Mira、Kymera Woodline、TUXEDO
12 GB|12B 到 14B|RTX 5070 · RX 7700 XT|任何 Linux 品牌整机的基础配置

System76。Thelio Mira 重新设计后是 Linux 塔式机的标杆。配置页 1699 美元起,从 RTX 5050 一路到 RX 9070 XT、5070 Ti、5080、5090,顶配两张换 1000 W 电源,最高 192 GB 内存,可选 Pop!_OS 24.04、Ubuntu 24.04 或 Ubuntu 26.04。它的 Thelio Major 工作站 6999 美元起,最高到 96 GB 的 RTX PRO 6000 Blackwell、配 256 GB ECC 内存。菜单上每张卡都在一等栈上。

Slimbook 和 TUXEDO。Slimbook 的 Kymera Woodline 最高配到 RX 9000 或 RTX 50 卡、192 GB 内存,出货时可装十三款发行版中任意一个,从 Ubuntu、Fedora 到 EndeavourOS。德国的 TUXEDO Computers 用 AMD 或 Intel 做迷你、中型、大型塔箱,预装自家基于 Ubuntu 的 TUXEDO OS。这三家都为自己卖的硬件担保驱动栈,而在 Linux 上这值得花钱。

NVIDIA。DGX Spark 是本篇里唯一只跑 Linux 的机器。NVIDIA 的规格页列了 Grace Blackwell GB10 芯片、128 GB 统一内存、273 GB/s、4 TB 存储、最高 2000 亿参数模型推理;它的 DGX OS 按 NVIDIA 自己的指南就是预装驱动和 CUDA 的 Ubuntu 24.04。带宽是 Strix Halo 级,所以稠密 70B 跑在 Strix Halo 的速度上。你花约 4700 美元买到的,是一台 Arm 桌面上的 CUDA 工具链——做微调的人在乎,只聊天的人不在乎。

三档预算的短名单

下面是栈和显存档位,而不是具体型号,因为下周有货的 SKU 会变,栈不会。

约 2000 美元 · NVIDIA 或在清单上的 AMD 塔式机:Thelio Mira 或 Kymera Woodline,配 RTX 5070 Ti 或 RX 9070 XT;16 GB 显存、32 GB 内存;8B 到 14B 全速、20B MoE、图像模型。两张卡都在一等栈上:CUDA,或 AMD ROCm 清单上的卡。跳过 12 GB,升到 16 GB 是梯子上最便宜的一步。

约 3500 美元 · 统一内存迷你主机:128 GB 的 Strix Halo 机器,Fedora 或 Ubuntu 26.04;96 GB 给 GPU、256 GB/s;70B 稠密慢跑、120B MoE 读速。这是 5000 美元以下越过 32 GB 的唯一一条路。买 128 GB 别买 64 GB,装一个内核过 6.16.9 的发行版,否则 GPU 只看得到一小部分内存。

5000 美元以上 · 32 GB 塔式机,或 CUDA 开发机:配 RTX 5090 的 Thelio Mira,或 DGX Spark;32 GB、1792 GB/s,或 128 GB、273 GB/s;32B 稠密快跑,或在 CUDA 工具链里慢跑 200B 级。5090 是通往 32 GB 最快的消费级路,而单是这张卡街价就接近 6900 美元。Spark 是给那些想在桌上放一台数据中心栈的人。

读这篇时两页内容贯穿始终。第一,两颗需要内核下限的 AMD 芯片——RX 9000 和 Strix Halo——在 Ubuntu 26.04、Fedora 44 和滚动发行版上都过线,在 Ubuntu 22.04 上都不过。如果你要在比 24.04 更老的系统上装最新硬件启用内核,就买 NVIDIA。第二,每一档里最便宜的显存,都在维护成本最高的栈上:Intel 的 32 GB、二手 NVIDIA 的 24 和 48、Strix Halo 的 96。想好你愿意给这台机器几个晚上,选对应的那一列,机箱自己就定了。

如果桌子是一台 Mac,或者你需要它随身带走,Mac 篇和笔记本篇跑的是同一架显存梯子,只是不用操心驱动。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|KDZNR网

GMT+8, 2026-9-26 22:27 , Processed in 0.056034 second(s), 20 queries .

Powered by Discuz! X3.4

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表