AirLLM 是什麼?4GB 顯卡跑 70B 大模型的黑科技,代價是慢
編輯:BJ最後檢查:2026-08-07主要來源:GitHub
AirLLM 是最近爆紅的開源 Python 函式庫,靠「一次只載入一層」的招式讓 4GB 顯卡也能跑 70B 大模型、不用量化不用閹割,本篇就講清楚它的原理、真實代價(速度很慢)、適合誰用,以及跟乖乖買大顯卡差在哪。

這東西為什麼突然爆紅
「4GB 顯卡跑 70B 模型」——第一眼看到你大概會覺得是標題詐騙。站上顯卡挑選文才說過,70B 級要 40GB 以上 VRAM,怎麼可能 4GB 就跑?
魔法談不上,AirLLM 只是把規則換掉。它最近兩週在 GitHub 從 6,900 星暴衝到 23,500 星,因為它替「VRAM 不夠」這道本機 AI 最大的門檻,開出了一條完全不同的繞路。
它是真的,代價是速度。原理和代價下面都講白,你再決定要不要玩。
原理:模型不用整個進卡,一層一層輪流進
一般跑模型的做法(Ollama、LM Studio 那套)是把整個模型塞進 VRAM,塞不下就完蛋。AirLLM 的做法不同:
大模型本來就是幾十層堆起來的。AirLLM 把它切成一層一層放在硬碟,算的時候一次只把「當前這一層」載入 VRAM,算完丟掉、換下一層進來。任何時刻卡裡只有一層,所以 4GB 也裝得下——它不用量化、不用裁剪,跑的是原汁原味的完整模型。
同樣的邏輯推到極致,官方宣稱 8GB 卡可以碰 405B 級的模型。VRAM 從「天花板」變成「輪流通過的閘門」。

真實代價:慢,而且是很慢
每一層都要從硬碟搬進搬出,時間全花在搬運上。社群實測跑超大模型時,生成速度常常不到每秒 1 個 token,回答一段話可能要等好幾分鐘。
所以先把期待調對:
- 不適合:即時聊天、日常助手、任何「我在等它回」的場景。你會等到懷疑人生。
- 適合:不趕時間的批次任務——睡前丟一批文件讓它慢慢分析、離線環境跑一次性的大模型實驗、單純想親眼看看 70B 級的輸出品質差多少。
一句話:它讓小卡「到得了」大模型——「跑得動」是另一回事。
適合誰玩
- 手上只有 4GB~8GB 的舊卡或筆電,想體驗大模型輸出品質的人。
- 做研究、做評測,需要在有限硬體上驗證大模型行為的人。
- 完全離線的環境(資安要求、無網機房),需要大模型但買不了大卡的人。
如果你的需求是日常順暢地用本機 AI,這條路不適合——乖乖看顯卡怎麼挑,或用 7B~14B 的小模型配 Ollama 比較實在。
怎麼開始
它是 Python 函式庫,會寫一點 Python 就能上:
pip install airllm幾行程式碼指定模型名稱就能跑,模型檔會從 Hugging Face 自動下載。要留意兩件事:硬碟空間(70B 模型檔上百 GB,SSD 快很多)和耐心(第一次載入和每次生成都慢)。
建議第一次先拿 70B 級試,不要直接挑戰 400B 以上,先感受一下這種速度你能不能接受。
使用前的三個提醒
速度預期要先講給自己聽。很多人裝完的第一反應是「壞掉了嗎怎麼沒反應」——沒壞,它就是這麼慢。拿它跑批次、掛著過夜,才是正確用法。
硬碟會被吃掉一大塊。大模型動輒上百 GB,玩幾個模型硬碟就滿了,先清空間再開始。
它解決「能不能」,「好不好用」要另外解。如果試完你真的愛上大模型的品質,長期解還是回到硬體:加卡、或考慮統一記憶體的 Mac 路線。
值不值得試?
免費、pip 一行、不用改硬體,光是「親眼看 70B 在自己電腦上跑起來」就值回票價。把它當成體驗票,別當日常交通工具——兩週兩萬星的暴紅,紅的就是這張票。
下一步可以先看什麼
- 跑本機 AI 顯卡怎麼挑:想「跑得動」而不只是「到得了」,看這篇。
- 我電腦能不能跑本機 AI:先搞懂 VRAM 和模型大小的關係。
- Ollama 入門:日常本機 AI 的主流做法。
參考來源
- AirLLM GitHub:https://github.com/lyogavin/airllm
本文最後查證日期:2026-08-07
延伸閱讀
想跑本機 AI 卻卡在不知道買哪張顯卡?其實關鍵只有一個——VRAM 夠不夠裝下模型,裝不下再強的卡都白搭,本篇就用白話講清楚 VRAM 怎麼估、三種預算各買什麼,以及二手卡跟 Mac 這兩條路值不值得走。
我電腦能不能跑本機 AI?RAM、VRAM、CPU 白話對照本機跑 AI 不是只看電腦新不新,而是看模型大小、RAM、VRAM、CPU 和量化格式,這篇用新手能懂的方式解釋電腦規格怎麼影響速度、能跑多大的模型,以及升級時該先看哪個零件。
Ollama 是什麼?在自己電腦跑 AI 模型的新手入門Ollama 是讓你在自己電腦下載、執行和管理 AI 模型的工具。本文用白話整理它能做什麼、去哪裡下載、要不要錢、電腦需要多強,以及新手第一個模型該怎麼跑。
Odysseus 是什麼?PewDiePie 做的自架 AI 工作空間,資料全留自己家全球最知名 YouTuber 之一 PewDiePie 在 2026 年開源了 Odysseus——一個把聊天、agent、深度研究、信箱、行事曆、筆記全裝進自己電腦的 AI 工作空間,本篇就帶你看它包了哪些功能、要什麼硬體、怎麼用 Docker 架起來,以及適不適合你。
Grok Build 是什麼?xAI 開源的終端機 coding agent,滑鼠也能點Grok Build 是 xAI 開源的官方 coding agent,用 Rust 打造、跑在終端機卻支援全螢幕與滑鼠操作,安裝一行指令搞定,本篇就帶你看它跟 OpenCode、Claude Code 這些對手差在哪、費用怎麼算,以及什麼人適合入坑。
Ontheia 是什麼?給團隊自架的 AI agent 平台,權限與個資都管得住個人玩 AI agent 很自由,公司要用就得面對權限、稽核、個資法遵這些麻煩事,Ontheia 把這些麻煩事當成產品核心,是開源自架的 agent 平台——多模型、長期記憶、多人權限控管、GDPR 取向設計一次到位,本篇帶你看它適合什麼團隊、跟 Dify 差在哪、怎麼評估要不要導入。