下載模型
模型權重是幾個大檔(常見副檔名 .gguf、.safetensors)。LM Studio 內建從 Hugging Face 搜尋、下載。選錯量化或選太大顆,不是「程式壞了」,是記憶體不夠。
Discover 怎麼用
- 開 Discover(Mac:Cmd+2,Windows/Linux:Ctrl+2)。
- 搜關鍵字(
qwen、gemma、llama)或貼user/model、甚至完整 Hugging Face 網址。 - 點進模型後,右側會列出不同量化版本與預估大小。
- 畫面若標 full GPU offload 或「這台可能跑不動」,以它為準,不要硬下載 70B 到 16GB 筆電。
官方:Download an LLM。
命令列等價操作是 lms get <模型>,見 lms 與 llmster。
量化是什麼
同一顆模型常會看到 Q3_K_S、Q4_K_M、Q8_0 這類名字。Q 代表量化(quantization):把權重壓小,換一點品質。數字愈大通常檔案愈大、品質愈接近原版。
新手實務:
- 先選 4-bit 左右(常標
Q4_K_M),在品質與 RAM 之間最常夠用。 - 記憶體很緊再往 3-bit 試;記憶體很寬再考慮 8-bit。
- 「7B、8B、14B」是參數規模,不是檔案的 GB 數。量化後 8B 模型常常是 4–6GB 一檔。
載入模型代表什麼
在 Chat 上方選模型,等於把權重放進 RAM(或 GPU 記憶體)。沒載入就無法對話。載入時可改 GPU offload、context length、Flash Attention;也可在 My Models 的齒輪設成該模型的預設值。官方:Per-model Defaults。
載入後若還要開第二顆,記憶體會疊加。用不到的模型請卸載。
模型放在哪
預設在使用者目錄下的 LM Studio 模型資料夾。可在 My Models 改路徑。從別處抓來的 GGUF,用 lms import 或 App 的匯入功能收進庫裡,不要只把檔案丟在隨意資料夾然後忘記。官方下載說明:Download an LLM。
授權
開源權重 ≠ 一定可商用。下載前看 Hugging Face 模型卡的 License。Discover 只負責幫你找到檔案。
下一步:聊天介面。