Skip to content

建立 2026-09-15 更新 2026-09-15

CLI 指令

終端機是 Ollama 的主介面。完整列表見 CLI Reference,下面只留每天會碰到的指令。

執行與下載

ollama run gemma4
ollama pull gemma4

run 會下載(若需要)並進入對話。只要下載、暫時不聊,用 pull

列出、詳情、刪除

ollama ls
ollama show gemma4
ollama show --modelfile gemma4
ollama rm gemma4

ls 看本機有哪些模型與大小。show 看架構與參數;--modelfile 可把現有模型當成 Modelfile 的起點。不用的模型用 rm 清磁碟。

記憶體裡正在跑的模型

ollama ps
ollama stop gemma4

ps 顯示名稱、佔用大小、CPU/GPU 比例,以及預計卸載時間。預設閒置約五分鐘後卸載。stop 立刻釋放。

服務本身

macOS/Windows 的 App 會自己啟動服務。Linux 或只要 API、不要桌面時:

ollama serve

ollama serve --help 會列出可設的環境變數。常見的包括:

  • OLLAMA_HOST:預設只綁 127.0.0.1:11434。要給區網其他機器用才改成 0.0.0.0:11434。Ollama 沒有內建帳號驗證,不要把這個埠直接暴露到公網。
  • OLLAMA_MODELS:模型存放目錄。
  • OLLAMA_CONTEXT_LENGTH:預設上下文長度(文件目前寫預設 4096 tokens)。
  • OLLAMA_KEEP_ALIVE:模型在記憶體停留多久。

各作業系統怎麼設環境變數,見 FAQ

登入雲端

ollama signin
ollama signout

:cloud 模型、推送模型或拉取私有模型時需要。公鑰位置也在 FAQ。

啟動整合

ollama launch
ollama launch claude --model qwen3.5

用來把 Ollama 接到 Claude Code、OpenCode、Codex、VS Code 等,細節見 整合工具

嵌入(embeddings)

部分模型是專門把句子變成向量,不是用來聊天:

ollama run embeddinggemma "Hello world"

輸出是 JSON 陣列,給搜尋或 RAG 用。不要拿 embedding 模型去當對話助理。

CLI、API 與 WebUI 一次走完

Leon van Zyl 約 14 分鐘:listpullrmrun、REPL 指令、Modelfile、API,最後裝 Open WebUI。對應本頁與後續兩章。