返回首頁

標籤

multimodal AI

多模態 AI 把文字、圖像、音訊與影片放進同一套模型與工作流,重點不只在生成內容,也在理解、編輯與代理式任務。從長上下文、視覺編修到語音與影片處理,這類模型正改變產品與開發方式。

8 篇文章

Gemini Live 用鏡頭把問題變答案
工具應用/7月24日

Gemini Live 用鏡頭把問題變答案

我拆 Gemini Live 的鏡頭與螢幕分享用法,整理成可直接套用的提問模板,讓你用看見的東西換到即時協助。

Kimi K2.5 價格與功能實測指南
工具應用/6月30日

Kimi K2.5 價格與功能實測指南

這篇教你評估 Kimi K2.5 的功能、價格與導入成本,並用一個小型試跑確認是否適合上線。

Gemma 4 把 256K 上下文帶進開放模型
模型發布/6月17日

Gemma 4 把 256K 上下文帶進開放模型

Google DeepMind 的 Gemma 4 加入文字、圖片、音訊輸入,最高 256K context,還提供五種開放權重規格,適合本機與伺服器部署。

ClinHallu 追蹤醫療 MLLM 幻覺來源
技術研究/6月15日

ClinHallu 追蹤醫療 MLLM 幻覺來源

ClinHallu 把醫療多模態模型的幻覺拆成看圖、記知識、做整合三段來診斷,讓開發者能定位錯誤來源。

為什麼 Gemini Drops 比模型名稱更重要
產業動態/6月6日

為什麼 Gemini Drops 比模型名稱更重要

Gemini Drops 才是 Google 真正的產品路線圖,不只是發表更新。

Kimi K2.6 把 256K 上下文帶進 API
模型發布/5月4日

Kimi K2.6 把 256K 上下文帶進 API

Kimi K2.6 為 API 開發者帶來 256K 上下文、圖像與影片輸入,還強化長程式碼任務的穩定度。

Gemma 4 登上 Google Cloud
模型發布/4月4日

Gemma 4 登上 Google Cloud

Gemma 4 進入 Google Cloud,支援 256K context、vision、audio 與 Apache 2.0 授權,還能跑在 Vertex AI、Cloud Run、GKE 與 TPU 上。

MiMo V2 Pro、Omni、Flash 怎麼選
模型發布/4月2日

MiMo V2 Pro、Omni、Flash 怎麼選

MiMo 2026 三款模型分工很清楚:Flash 主打開源與 coding,Pro 提供 1M context,Omni 則處理圖像、音訊與影片。這篇直接比 benchmark、價格與適用場景。