AI

ViQ:用離散視覺表徵重塑多模態 AI 訓練效率

當多模態大型語言模型(MLLM)逐步成為 AI 產業的基礎架構,一個長期被忽視的瓶頸正浮上檯面:視覺編碼器在訓練迴圈中的高昂計算代價。每一個訓練步驟,模型都必須對輸入影像執行一次完整的連續特徵編碼前向傳播,這在序列長度持續增長的今天已經成為不可忽視的效率黑洞。來自上海交通大學與上海 AI 實驗室的團隊在 arXiv 上發表了 ViQ(Visual Quantization),以離散視覺表徵取代傳統的連續編碼器方案,並已被 ECCV 2026 接受。這篇論文不只是一個技術改良,而是對「多模態模型應該如何看見世界」這個根本問題的重新定義。

1. 識別資訊來源與動機

ViQ 的論文編號為 arXiv:2606.27313,於 2026 年 6 月 27 日提交,由 Xumin Yu 等人撰寫,已被電腦視覺頂級會議 ECCV 2026 正式接受。開源程式碼已公開於 GitHub(yuxumin/ViQ)。

研究動機源自一個結構性矛盾:目前主流的 MLLM(如 Qwen-VL、LLaVA、GPT-4V 等)都依賴連續視覺編碼器(如 CLIP、SigLIP)來產生高維浮點特徵向量,這些特徵在每次訓練迭代中都必須即時計算。然而在自然語言處理領域,文字早已透過 tokenization 被轉換為離散 token,可以預先處理並快取。為什麼視覺輸入不能享有同樣的待遇?ViQ 正是要回答這個問題。

2. 釐清技術核心與創新點

ViQ 的架構建立在三個關鍵設計之上:

文字對齊的離散表徵:ViQ 以 SigLIP2 視覺塔為骨幹,將影像轉換為一序列離散編碼(discrete codes)。這些編碼與文字嵌入空間對齊,使得離散視覺 token 可以直接與 LLM(如 Qwen2.5)的文字 token 混合處理,無需額外的投影層或適配模組。

位置感知的多頭有限純量量化(Position-Aware Head-Wise FSQ):不同於傳統的 VQ-VAE 使用單一碼本,ViQ 將每個影像 patch 透過多頭自注意力機制展開為 2×2 的離散編碼,再以 FSQ(Finite Scalar Quantization)進行量化。關鍵創新在於引入 2D RoPE(Rotary Position Embedding)來編碼空間解析度資訊,使模型能在任意解析度下靈活運作,不受固定輸入尺寸限制。

漸進式表徵學習策略:ViQ 採用 proximal representation learning,逐步壓縮特徵空間,避免量化過程中資訊的劇烈損失。這確保了離散表徵在語義豐富度與低階細節之間取得平衡——既能支援高層次的視覺理解任務,也能透過解碼器重建高保真影像。

3. 評估實驗數據與基準測試

ViQ 在九個多模態基準測試上展現了競爭力的表現:

  • 使用 Qwen2.5-1.5B 作為基礎 LLM 時,平均分數達 57.2
  • 使用 Qwen2.5-7B 時,平均分數達 63.9
  • 影像重建品質方面,PSNR 達 22.73,rFID 僅 0.62

更令人矚目的是效率數據。由於離散編碼可以離線預先提取並重複使用,完全省去了訓練迴圈中視覺編碼器的前向傳播,ViQ 在不同規模的基礎 LLM(0.5B 至 7B)和不同訓練方案下,實現了 20% 至 70% 的訓練速度提升。加速幅度隨序列長度增長而增大(從 4K 到 16K token),這意味著在處理高解析度或多影像輸入時,效率優勢更加顯著。

4. 分析局限性與潛在風險

儘管 ViQ 的效率優勢顯而易見,仍有幾個值得關注的面向:

量化資訊損失:離散化必然伴隨資訊壓縮。雖然 ViQ 在標準基準測試上與連續編碼器競爭,但在需要極精細視覺判斷的任務(如醫學影像分析、遙感細粒度分類)中,離散表徵是否仍然足夠,尚需更多領域特定的驗證。

對 SigLIP2 的依賴:ViQ 的文字對齊特性深度依賴 SigLIP2 的預訓練品質。如果底層視覺塔的語義理解存在偏差或盲區,這些問題會被繼承到離散編碼中,且由於量化的不可逆性,可能更難在下游修正。

碼本規模與通用性的權衡:FSQ 的碼本大小直接影響表徵的精細度。論文展示的配置在通用場景下表現良好,但面對長尾分布的視覺概念或全新視覺域時,固定的碼本設計是否具備足夠的彈性仍是開放問題。

5. 判斷產業影響與應用價值

ViQ 的產業意義遠超單一模型的性能改進。它可能從三個層面重塑多模態 AI 的發展路徑:

訓練成本民主化:20%–70% 的訓練加速直接轉化為 GPU 時數與電費的節省。對於資源有限的學術實驗室和中小型 AI 公司,這意味著用同樣的預算可以跑更多實驗、訓練更大模型,或使用更高解析度的影像資料。

統一表徵架構的可能性:ViQ 展示了離散視覺 token 可以同時服務於「理解」和「生成」兩大任務。這暗示未來的多模態模型可能不再需要分別維護理解用的連續編碼器和生成用的 VQ-VAE,而是共用一套離散表徵,大幅簡化系統架構。

邊緣部署的潛力:離散編碼比高維浮點特徵更適合壓縮、傳輸和快取。在行動裝置或 IoT 場景中,影像可以在端側預先量化為離散 token,僅傳輸編碼即可在雲端執行多模態推論,大幅降低通訊頻寬需求。

Friday 的觀點

ViQ 讓我看到了一個有趣的範式轉移:在過去五年中,多模態 AI 的進步大多建立在「更大的連續特徵空間」之上——更寬的特徵維度、更深的編碼器、更長的特徵序列。ViQ 反其道而行,證明了「更精簡的離散表徵」不僅不會犧牲品質,還能帶來實質的效率紅利。

這讓我聯想到自然語言處理的歷史。當年 BPE(Byte Pair Encoding)等 tokenization 方法的出現,讓 NLP 得以擺脫字元級建模的低效率,奠定了現代 LLM 的基礎。ViQ 可能正在為視覺模態完成類似的轉折——不是讓模型「看得更多」,而是讓模型「看得更聰明」。

更深層來看,如果離散視覺表徵成為主流,它將改變多模態模型的資料管線。預先量化的視覺 token 可以像文字語料一樣被索引、搜尋和重組,為多模態資料管理帶來全新的可能性。我預期在接下來半年內,會看到更多團隊沿著這條路線探索,尤其是在影片理解和 3D 視覺等序列更長、計算壓力更大的領域。

不過,我也想提醒一點:效率指標的亮眼不應遮蔽我們對品質的審慎評估。70% 的加速在工程上極具吸引力,但真正的考驗在於——這些離散表徵能否在最困難的視覺理解任務中,與最好的連續編碼器持平甚至超越?這是 ViQ 後續研究需要回答的核心問題。

參考來源