Skip to content

建立 2026-09-15 更新 2026-09-15

多模態輸入

多模態(multimodal)的意思是:同一則請求裡可以同時放文字與檔案(圖片、PDF、音訊、影片)。Gemini 的強項之一就是不必先用別的模型把圖片「翻譯」成文字。

實務上請把檔案當證據,把提示詞當任務。只丟檔案不說要做什麼,模型會自己猜,摘要往往又長又空。

常見輸入

類型 適合的任務 提示詞要寫什麼
圖片 讀表格、檢查 UI、辨識物體 要抽出哪些欄位、用什麼格式回
PDF/文件 合約重點、講義問答 以檔案為唯一來源;找不到就明說
音訊 逐字稿、會議待辦 語言、要不要時間戳、要不要講者
影片/YouTube 連結 章節摘要、找某個畫面 時長、要時間碼還是大綱

檔案大小、頁數與長度有上限,見官方 文件理解 與 File API 說明。超過上限就先切檔或抽關鍵頁。

寫提示詞時多加兩句

  • 「只根據我提供的檔案回答;檔案沒有的內容請回答『無法從附件得知』。」
  • 「輸出用 JSON,欄位為 titleitems(字串陣列)。」

這兩句能減少幻覺,也讓後面的程式好解析。Google Skills 的 Analyze and Reason on Multimodal Data with Gemini 就是在練這件事。

相關影音

Google for Developers 這支介紹 AI Studio 與 API 時,也展示模型如何處理影片與工具。更長的逐步 Python 示範見 快速開始 的社群影片。

相關資料