模型庫與選擇
到 ollama.com/library 選模型時,頁面上的 ollama run 名稱 就是你要貼進終端機的指令。同一個家族通常有多個標籤(tag),差別在參數規模、量化精度,以及本機或雲端。
名稱在說什麼
以常見寫法 mistral:7b-instruct-q4_0 為例(實際字串以圖書館為準):
- 家族名稱(
mistral、llama3.2、gemma4、qwen3):誰訓練、什麼用途。 - 參數規模(
1b、7b、70b):數字愈大通常能力愈強,也愈吃記憶體。 - instruct/chat:針對對話微調,適合當助理;沒有這類字的常是補全用基礎模型。
- 量化(
q4、q8):把權重從高精度壓縮。預設多半是約 4-bit,體積約只有完整精度的八分之一,多數筆電都從這裡開始。
沒寫標籤時,Ollama 會選該模型的預設變體,通常是最常用、也較省記憶體的那一檔。
硬體怎麼配(粗估)
官方沒有替每台電腦保證「一定能跑」的表,但社群常用這條經驗:
| 本機記憶體(粗估) | 先試的規模 |
|---|---|
| 8 GB | 1B~3B,或很小的 7B 量化檔 |
| 16 GB | 7B~8B(最常見的甜蜜點) |
| 32 GB | 13B~14B,或較大的量化 30B |
| 更高/獨立 GPU 顯存充足 | 再往 70B 或官方標成 workstation 的變體 |
還要扣作業系統與其他程式。ollama ps 的 Processor 欄可看出是 GPU、CPU 還是兩者各佔一部分。若整段都在 CPU 且非常慢,先換更小的標籤,而不是先調參數。
中文任務可優先看 Qwen、Gemma 等在圖書館說明裡提到多語的模型;寫程式再看標成 coding 的變體。
本機、雲端與隱私
- 本機標籤:權重在你的磁碟。官方說明:本機執行時他們看不到你的提示詞與回答。
:cloud標籤:推論在 ollama.com。官方表示會處理提示與回應以提供服務,但不儲存內容、不用來訓練。仍須ollama signin。
只要提示詞離開這台機器,就不能再稱為「完全離線」。接瀏覽器、MCP 或外部搜尋時也一樣。
選完之後
複製圖書館頁面上的指令,例如:
run 在還沒下載時也會順便 pull。磁碟不夠就先 ollama ls 刪掉不用的模型,見 CLI 指令。
量化與模型名稱
Matt Williams 在入門片後半說明為什麼 7B 全精度吃不下一般顯卡、Q4 在做什麼,以及 instruct 與 base 的差別。對應本頁「名稱在說什麼」。