GPT-5 正式發表:影片看懂、不會亂掰,台灣人該知道的 3 個改變

GPT-5 正式發表:影片看懂、不會亂掰,台灣人該知道的 3 個改變

GPT-5 正式發表:影片看懂、不會亂掰,台灣人該知道的 3 個改變

這次 OpenAI 沒再畫大餅

GPT-5 的消息終於落地。但跟以往「參數量翻倍」的宣傳不同,這次 OpenAI 把重點放在兩件事:減少幻覺(就是 AI 亂講話的毛病),還有真正的多模態——不只是看圖,是能處理影片。

對每天在用 ChatGPT 的台灣人來說,這代表什麼?


第一個改變:終於敢把 AI 寫的東西直接交出去

「幻覺」聽起來很玄,其實就是你問 AI 問題,它很認真地給你編一個答案。像請 ChatGPT 整理某個台灣品牌的市佔率,它可能直接捏造數字,還標註「根據 2024 年報告」——根本沒這份報告。

GPT-5 把「可靠度」當成核心目標。OpenAI 的說法是 outputs will be more factually grounded,白話講就是會先確認自己真的知道,而不是硬湊一個看起來合理的答案。

對你的影響:

  • 做簡報不用再逐句查證
  • 寫報告引用 AI 整理的資料,風險大幅降低
  • 客服回覆、法律文件這種「不能錯」的場景,終於能放心用

第二個改變:影片變成可以「問」的資料

以前的多模態是「上傳一張圖,問這是什麼」。GPT-5 現在能處理影片——你可以丟一段 20 分鐘的 YouTube 教學、一場線上會議錄影,甚至是一支產品開箱片,然後直接問它問題。

想像這些場景:

情境以前的做法GPT-5 的做法
學生補習看 2 小時錄影,自己拉時間軸做筆記問「第幾分鐘講到三角函數公式?」
上班族開會聽完整場錄音,手打會議紀錄問「這場會議的決議事項有哪些?誰負責?」
追劇學英文反覆暫停查單字問「這句台詞的語境是什麼意思?」

這不是「把影片轉成文字稿」這麼簡單。GPT-5 是理解影片的內容結構——知道哪段是重點、哪段是閒聊、哪個畫面對應什麼資訊。


第三個改變:語音、圖像、文字「混在一起」用

GPT-5 的另一個關鍵字是 seamless multimodality——無縫多模態。意思是你可以在同一段對話裡,隨時切換輸入方式:

  1. 先傳一張菜單照片 → 問「這間店有沒有素食選項?」
  2. AI 回答後,直接用語音追問 → 「那最近的捷運站是哪一站?」
  3. 再貼一段店家的宣傳影片 → 「這支影片說的優惠還有效嗎?」

整個過程不用重新開對話,AI 會記住上下文。這對台灣人特別實用——你正在 LINE 群組討論聚餐,直接截圖、錄音、傳影片給 AI,比打字快多了。


什麼時候能用?還不知道,但「很快」

OpenAI 這次沒給確切日期,只說「coming soon」。根據過往經驗,可能是幾週到幾個月內逐步開放:

  • ChatGPT Plus 用戶 → 通常第一批
  • 免費版用戶 → 可能晚幾週,或功能受限
  • API 開發者 → 要等另外的公告

一個值得注意的細節:這次發表特別強調「可靠性」,而不是「更聰明」。這代表 OpenAI 的策略轉變——從「讓你驚豔」變成「讓你敢用」。對企業客戶和一般使用者來說,這其實是更好的消息。


現在可以做的事

雖然 GPT-5 還沒上線,你可以先準備:

  1. 整理你常問的「高風險問題」——哪些是你現在不敢直接複製貼上的?等 GPT-5 出來再測一次
  2. 把常用影片清單列出來——補習錄影、會議錄音、教學頻道,這些都是 GPT-5 上線後的第一批測試素材
  3. 確認你的 ChatGPT 帳號狀態——Plus 訂閱(約 600 台幣/月)通常能最早用到新功能

GPT-5 不會讓 AI 變成萬能博士,但如果它真的大幅減少「亂講話」,對每天依賴 AI 的人來說,這比什麼新功能都重要。現在就打開 ChatGPT,想想你最常被 AI 騙過的問題是什麼,等上線後第一個測。