文件對話
在 Chat 裡附加 .pdf、.docx、.txt,模型就能根據檔案內容回答。檔案留在本機,不會因為用 LM Studio 就自動上傳到雲端。
整份塞進去,還是 RAG?
上下文(context)是模型這一次能「看見」的工作記憶,長度以 token 計。一份短文件若塞得進目前的 context length,LM Studio 會把全文放進對話。這通常比檢索準,也適合長上下文模型。
文件太長時,會改走檢索增強生成(Retrieval-Augmented Generation, RAG):先找出可能相關的片段,再交給模型。有時很準,有時會漏掉關鍵段落,需要你把問題寫得更具體。
| 情況 | 通常發生什麼 |
|---|---|
| 一頁摘要、短合約、README | 全文進上下文 |
| 整本書、長報告、多檔一次丟 | 走 RAG,只送檢索到的片段 |
把 context 開很大可以讓更多全文塞進去,但 RAM 會跟著漲,生成也變慢。
問法
官方建議:問題裡盡量出現你預期會在原文裡看到的詞。例如不要只問「這份文件重點是什麼」,改成「第三章關於保證期間與除外責任怎麼寫」。檢索靠關鍵字對得上,本地小模型尤其明顯。
不要把幻覺當引用
RAG 只是「多給幾段參考」。模型仍可能講出檔案裡沒有的話。重要數字、條款請回原檔核對。
下一步若要讓模型去開網頁或呼叫外部工具,見 MCP。