這次 OpenAI 沒再畫大餅
GPT-5 的消息終於落地。但跟以往「參數量翻倍」的宣傳不同,這次 OpenAI 把重點放在兩件事:減少幻覺(就是 AI 亂講話的毛病),還有真正的多模態——不只是看圖,是能處理影片。
對每天在用 ChatGPT 的台灣人來說,這代表什麼?
第一個改變:終於敢把 AI 寫的東西直接交出去
「幻覺」聽起來很玄,其實就是你問 AI 問題,它很認真地給你編一個答案。像請 ChatGPT 整理某個台灣品牌的市佔率,它可能直接捏造數字,還標註「根據 2024 年報告」——根本沒這份報告。
GPT-5 把「可靠度」當成核心目標。OpenAI 的說法是 outputs will be more factually grounded,白話講就是會先確認自己真的知道,而不是硬湊一個看起來合理的答案。
對你的影響:
- 做簡報不用再逐句查證
- 寫報告引用 AI 整理的資料,風險大幅降低
- 客服回覆、法律文件這種「不能錯」的場景,終於能放心用
第二個改變:影片變成可以「問」的資料
以前的多模態是「上傳一張圖,問這是什麼」。GPT-5 現在能處理影片——你可以丟一段 20 分鐘的 YouTube 教學、一場線上會議錄影,甚至是一支產品開箱片,然後直接問它問題。
想像這些場景:
| 情境 | 以前的做法 | GPT-5 的做法 |
|---|---|---|
| 學生補習 | 看 2 小時錄影,自己拉時間軸做筆記 | 問「第幾分鐘講到三角函數公式?」 |
| 上班族開會 | 聽完整場錄音,手打會議紀錄 | 問「這場會議的決議事項有哪些?誰負責?」 |
| 追劇學英文 | 反覆暫停查單字 | 問「這句台詞的語境是什麼意思?」 |
這不是「把影片轉成文字稿」這麼簡單。GPT-5 是理解影片的內容結構——知道哪段是重點、哪段是閒聊、哪個畫面對應什麼資訊。
第三個改變:語音、圖像、文字「混在一起」用
GPT-5 的另一個關鍵字是 seamless multimodality——無縫多模態。意思是你可以在同一段對話裡,隨時切換輸入方式:
- 先傳一張菜單照片 → 問「這間店有沒有素食選項?」
- AI 回答後,直接用語音追問 → 「那最近的捷運站是哪一站?」
- 再貼一段店家的宣傳影片 → 「這支影片說的優惠還有效嗎?」
整個過程不用重新開對話,AI 會記住上下文。這對台灣人特別實用——你正在 LINE 群組討論聚餐,直接截圖、錄音、傳影片給 AI,比打字快多了。
什麼時候能用?還不知道,但「很快」
OpenAI 這次沒給確切日期,只說「coming soon」。根據過往經驗,可能是幾週到幾個月內逐步開放:
- ChatGPT Plus 用戶 → 通常第一批
- 免費版用戶 → 可能晚幾週,或功能受限
- API 開發者 → 要等另外的公告
一個值得注意的細節:這次發表特別強調「可靠性」,而不是「更聰明」。這代表 OpenAI 的策略轉變——從「讓你驚豔」變成「讓你敢用」。對企業客戶和一般使用者來說,這其實是更好的消息。
現在可以做的事
雖然 GPT-5 還沒上線,你可以先準備:
- 整理你常問的「高風險問題」——哪些是你現在不敢直接複製貼上的?等 GPT-5 出來再測一次
- 把常用影片清單列出來——補習錄影、會議錄音、教學頻道,這些都是 GPT-5 上線後的第一批測試素材
- 確認你的 ChatGPT 帳號狀態——Plus 訂閱(約 600 台幣/月)通常能最早用到新功能
GPT-5 不會讓 AI 變成萬能博士,但如果它真的大幅減少「亂講話」,對每天依賴 AI 的人來說,這比什麼新功能都重要。現在就打開 ChatGPT,想想你最常被 AI 騙過的問題是什麼,等上線後第一個測。