AI 工具雷達
GitHub 與進階 AI 工具新手難度:Docker:通常不用來源:GitHub4 分鐘閱讀

AirLLM 是什麼?4GB 顯卡跑 70B 大模型的黑科技,代價是慢

編輯:BJ最後檢查:2026-08-07主要來源:GitHub

AirLLM 是最近爆紅的開源 Python 函式庫,靠「一次只載入一層」的招式讓 4GB 顯卡也能跑 70B 大模型、不用量化不用閹割,本篇就講清楚它的原理、真實代價(速度很慢)、適合誰用,以及跟乖乖買大顯卡差在哪。

AirLLM 逐層載入示意圖:巨大模型被切成一層一層,輪流送進小顯卡運算
自製示意圖:AirLLM 的招式是「模型切層、輪流進卡」——小顯卡也能跑大模型,但要排隊所以慢。

這東西為什麼突然爆紅

「4GB 顯卡跑 70B 模型」——第一眼看到你大概會覺得是標題詐騙。站上顯卡挑選文才說過,70B 級要 40GB 以上 VRAM,怎麼可能 4GB 就跑?

魔法談不上,AirLLM 只是把規則換掉。它最近兩週在 GitHub 從 6,900 星暴衝到 23,500 星,因為它替「VRAM 不夠」這道本機 AI 最大的門檻,開出了一條完全不同的繞路。

它是真的,代價是速度。原理和代價下面都講白,你再決定要不要玩。

原理:模型不用整個進卡,一層一層輪流進

一般跑模型的做法(Ollama、LM Studio 那套)是把整個模型塞進 VRAM,塞不下就完蛋。AirLLM 的做法不同:

大模型本來就是幾十層堆起來的。AirLLM 把它切成一層一層放在硬碟,算的時候一次只把「當前這一層」載入 VRAM,算完丟掉、換下一層進來。任何時刻卡裡只有一層,所以 4GB 也裝得下——它不用量化、不用裁剪,跑的是原汁原味的完整模型。

同樣的邏輯推到極致,官方宣稱 8GB 卡可以碰 405B 級的模型。VRAM 從「天花板」變成「輪流通過的閘門」。

AirLLM 與一般做法對比:左邊整個模型塞進大 VRAM,右邊模型切層存硬碟、一層一層輪流進小 VRAM

真實代價:慢,而且是很慢

每一層都要從硬碟搬進搬出,時間全花在搬運上。社群實測跑超大模型時,生成速度常常不到每秒 1 個 token,回答一段話可能要等好幾分鐘。

所以先把期待調對:

  • 不適合:即時聊天、日常助手、任何「我在等它回」的場景。你會等到懷疑人生。
  • 適合:不趕時間的批次任務——睡前丟一批文件讓它慢慢分析、離線環境跑一次性的大模型實驗、單純想親眼看看 70B 級的輸出品質差多少。

一句話:它讓小卡「到得了」大模型——「跑得動」是另一回事。

適合誰玩

  • 手上只有 4GB~8GB 的舊卡或筆電,想體驗大模型輸出品質的人。
  • 做研究、做評測,需要在有限硬體上驗證大模型行為的人。
  • 完全離線的環境(資安要求、無網機房),需要大模型但買不了大卡的人。

如果你的需求是日常順暢地用本機 AI,這條路不適合——乖乖看顯卡怎麼挑,或用 7B~14B 的小模型配 Ollama 比較實在。

怎麼開始

它是 Python 函式庫,會寫一點 Python 就能上:

pip install airllm

幾行程式碼指定模型名稱就能跑,模型檔會從 Hugging Face 自動下載。要留意兩件事:硬碟空間(70B 模型檔上百 GB,SSD 快很多)和耐心(第一次載入和每次生成都慢)。

建議第一次先拿 70B 級試,不要直接挑戰 400B 以上,先感受一下這種速度你能不能接受。

使用前的三個提醒

速度預期要先講給自己聽。很多人裝完的第一反應是「壞掉了嗎怎麼沒反應」——沒壞,它就是這麼慢。拿它跑批次、掛著過夜,才是正確用法。

硬碟會被吃掉一大塊。大模型動輒上百 GB,玩幾個模型硬碟就滿了,先清空間再開始。

它解決「能不能」,「好不好用」要另外解。如果試完你真的愛上大模型的品質,長期解還是回到硬體:加卡、或考慮統一記憶體的 Mac 路線

值不值得試?

免費、pip 一行、不用改硬體,光是「親眼看 70B 在自己電腦上跑起來」就值回票價。把它當成體驗票,別當日常交通工具——兩週兩萬星的暴紅,紅的就是這張票。

下一步可以先看什麼

參考來源

  • AirLLM GitHub:https://github.com/lyogavin/airllm

本文最後查證日期:2026-08-07

延伸閱讀

跑本機 AI 顯卡怎麼挑?看 VRAM 就對了,三種預算直接給答案

想跑本機 AI 卻卡在不知道買哪張顯卡?其實關鍵只有一個——VRAM 夠不夠裝下模型,裝不下再強的卡都白搭,本篇就用白話講清楚 VRAM 怎麼估、三種預算各買什麼,以及二手卡跟 Mac 這兩條路值不值得走。

我電腦能不能跑本機 AI?RAM、VRAM、CPU 白話對照

本機跑 AI 不是只看電腦新不新,而是看模型大小、RAM、VRAM、CPU 和量化格式,這篇用新手能懂的方式解釋電腦規格怎麼影響速度、能跑多大的模型,以及升級時該先看哪個零件。

Ollama 是什麼?在自己電腦跑 AI 模型的新手入門

Ollama 是讓你在自己電腦下載、執行和管理 AI 模型的工具。本文用白話整理它能做什麼、去哪裡下載、要不要錢、電腦需要多強,以及新手第一個模型該怎麼跑。

Odysseus 是什麼?PewDiePie 做的自架 AI 工作空間,資料全留自己家

全球最知名 YouTuber 之一 PewDiePie 在 2026 年開源了 Odysseus——一個把聊天、agent、深度研究、信箱、行事曆、筆記全裝進自己電腦的 AI 工作空間,本篇就帶你看它包了哪些功能、要什麼硬體、怎麼用 Docker 架起來,以及適不適合你。

Grok Build 是什麼?xAI 開源的終端機 coding agent,滑鼠也能點

Grok Build 是 xAI 開源的官方 coding agent,用 Rust 打造、跑在終端機卻支援全螢幕與滑鼠操作,安裝一行指令搞定,本篇就帶你看它跟 OpenCode、Claude Code 這些對手差在哪、費用怎麼算,以及什麼人適合入坑。

Ontheia 是什麼?給團隊自架的 AI agent 平台,權限與個資都管得住

個人玩 AI agent 很自由,公司要用就得面對權限、稽核、個資法遵這些麻煩事,Ontheia 把這些麻煩事當成產品核心,是開源自架的 agent 平台——多模型、長期記憶、多人權限控管、GDPR 取向設計一次到位,本篇帶你看它適合什麼團隊、跟 Dify 差在哪、怎麼評估要不要導入。