Skip to content

建立 2026-09-15 更新 2026-09-15

模型庫與選擇

ollama.com/library 選模型時,頁面上的 ollama run 名稱 就是你要貼進終端機的指令。同一個家族通常有多個標籤(tag),差別在參數規模、量化精度,以及本機或雲端。

名稱在說什麼

以常見寫法 mistral:7b-instruct-q4_0 為例(實際字串以圖書館為準):

  • 家族名稱mistralllama3.2gemma4qwen3):誰訓練、什麼用途。
  • 參數規模1b7b70b):數字愈大通常能力愈強,也愈吃記憶體。
  • instruct/chat:針對對話微調,適合當助理;沒有這類字的常是補全用基礎模型。
  • 量化q4q8):把權重從高精度壓縮。預設多半是約 4-bit,體積約只有完整精度的八分之一,多數筆電都從這裡開始。

沒寫標籤時,Ollama 會選該模型的預設變體,通常是最常用、也較省記憶體的那一檔。

硬體怎麼配(粗估)

官方沒有替每台電腦保證「一定能跑」的表,但社群常用這條經驗:

本機記憶體(粗估) 先試的規模
8 GB 1B~3B,或很小的 7B 量化檔
16 GB 7B~8B(最常見的甜蜜點)
32 GB 13B~14B,或較大的量化 30B
更高/獨立 GPU 顯存充足 再往 70B 或官方標成 workstation 的變體

還要扣作業系統與其他程式。ollama ps 的 Processor 欄可看出是 GPUCPU 還是兩者各佔一部分。若整段都在 CPU 且非常慢,先換更小的標籤,而不是先調參數。

中文任務可優先看 Qwen、Gemma 等在圖書館說明裡提到多語的模型;寫程式再看標成 coding 的變體。

本機、雲端與隱私

  • 本機標籤:權重在你的磁碟。官方說明:本機執行時他們看不到你的提示詞與回答。
  • :cloud 標籤:推論在 ollama.com。官方表示會處理提示與回應以提供服務,但不儲存內容、不用來訓練。仍須 ollama signin

只要提示詞離開這台機器,就不能再稱為「完全離線」。接瀏覽器、MCP 或外部搜尋時也一樣。

選完之後

複製圖書館頁面上的指令,例如:

ollama pull gemma4
ollama run gemma4

run 在還沒下載時也會順便 pull。磁碟不夠就先 ollama ls 刪掉不用的模型,見 CLI 指令

量化與模型名稱

Matt Williams 在入門片後半說明為什麼 7B 全精度吃不下一般顯卡、Q4 在做什麼,以及 instruct 與 base 的差別。對應本頁「名稱在說什麼」。