多模態輸入
多模態(multimodal)的意思是:同一則請求裡可以同時放文字與檔案(圖片、PDF、音訊、影片)。Gemini 的強項之一就是不必先用別的模型把圖片「翻譯」成文字。
實務上請把檔案當證據,把提示詞當任務。只丟檔案不說要做什麼,模型會自己猜,摘要往往又長又空。
常見輸入
| 類型 | 適合的任務 | 提示詞要寫什麼 |
|---|---|---|
| 圖片 | 讀表格、檢查 UI、辨識物體 | 要抽出哪些欄位、用什麼格式回 |
| PDF/文件 | 合約重點、講義問答 | 以檔案為唯一來源;找不到就明說 |
| 音訊 | 逐字稿、會議待辦 | 語言、要不要時間戳、要不要講者 |
| 影片/YouTube 連結 | 章節摘要、找某個畫面 | 時長、要時間碼還是大綱 |
檔案大小、頁數與長度有上限,見官方 文件理解 與 File API 說明。超過上限就先切檔或抽關鍵頁。
寫提示詞時多加兩句
- 「只根據我提供的檔案回答;檔案沒有的內容請回答『無法從附件得知』。」
- 「輸出用 JSON,欄位為
title、items(字串陣列)。」
這兩句能減少幻覺,也讓後面的程式好解析。Google Skills 的 Analyze and Reason on Multimodal Data with Gemini 就是在練這件事。
相關影音
Google for Developers 這支介紹 AI Studio 與 API 時,也展示模型如何處理影片與工具。更長的逐步 Python 示範見 快速開始 的社群影片。