2023 AI 頂會導讀:電腦視覺篇
2023 是 CV 從「看圖」走向「理解+生成+控制」的一年——Segment Anything 讓分割變成 zero-shot 通用能力,ControlNet 讓擴散模型可精準控制,3D Gaussian Splatting 以即時渲染速度挑戰 NeRF,DreamBooth 和 InstructPix2Pix 把文生圖從「生成」推向「編輯」。CVPR 投稿量突破九千、ICCV 突破八千,兩場會議恢復實體舉辦,規模與密度同創新高。
2023 是 CV 從「看圖」走向「理解+生成+控制」的一年——Segment Anything 讓分割變成 zero-shot 通用能力,ControlNet 讓擴散模型可精準控制,3D Gaussian Splatting 以即時渲染速度挑戰 NeRF,DreamBooth 和 InstructPix2Pix 把文生圖從「生成」推向「編輯」。CVPR 投稿量突破九千、ICCV 突破八千,兩場會議恢復實體舉辦,規模與密度同創新高。
2024 是 3D Gaussian Splatting 全面接管 3D 重建、video generation 從研究走向產品、vision-language model 深入各垂直領域的一年。CVPR 投稿量突破 11,500 篇再創紀錄,Best Paper 給了 Google Research 的 Generative Image Dynamics 和 UCSD/Google 合作的 Rich Human Feedback for Text-to-Image Generation;ECCV Best Paper 則頒給哥倫比亞大學的 Minimalist Vision with Freeform Pixels——一篇回歸光學基礎物理的非典型得獎作。
2026 年 3D 生成的核心範式是「video diffusion → feed-forward 3D 重建」,Lyra 2.0 是這條線的代表作。但 CVPR 2026 的三篇 Best Paper 暗示下一波轉向:SAM 3D 帶來 foundation model 級別的物件重建、D4RT 用統一 transformer 數秒重建動態 4D、O-Voxel 用結構化 latent 取代 Gaussian。3DGS 仍是主流但正在被表面原語挑戰,pixel-space diffusion 正在反攻 latent-space。