所有標籤 K2 Horizon 375B-A23B(IFM/K2-Horizon-375B-A23B):2026-09-03 由阿布達比 Institute of Foundation Models(MBZUAI 旗下)發佈,375B 總參數/23B 啟用(MoE)、512K(524,288 tokens)原生 context、Apache-2.0 全開源(權重、程式碼、訓練資料配方、中繼 checkpoint 全公開),官方未提供 API 定價(開源自架);Terminal-Bench 2.1 70.2%、SWE Bench Pro 42.6%、SWE-Atlas-QnA 48.4%(開源模型最高分);同系列還有 36B-A4B(新 MoVA 稀疏注意力架構)、32B、7B、3.7B、0.9B 共六款模型一次發佈
Gemini 3.8 Flash(gemini-3.8-flash):2026-09-02 上線,1,048,576 tokens input/64,000 tokens output,input $0.75、output $3.75 per 1M tokens(優惠價至 2026-12-31,之後 $1.50/$7.50,與 3.7 Flash 同價);Terminal-Bench 2.1 90.8%(前代 81.6%)、DeepSWE v1.1 73.7%(前代 65.3%);同步推出僅限受信任防禦者透過 Fairwind Program 申請的資安變體 Gemini 3.8 Flash Cyber,CWE-Bench pass@1 47.2%、真實 20 語言漏洞挖掘成功率逾 70%
Muse Voice Transcribe(muse-voice-transcribe-1.0):Meta Superintelligence Labs 首款即時語音感知模型,2026-09-01 上線;閉源,僅提供 API,$0.18/小時音訊($3.00/千分鐘);Streaming 最終逐字稿 WER 3.1%(Artificial Analysis AA-WER Streaming 第一,優於 Cartesia Ink-2 的 3.4%),語音結束到出稿延遲僅 0.16 秒;單一模型同時做 ASR、20+ 人 diarization、endpointing,取代過去需串接三套系統的作法
Gemini Omni 1.1 Flash(gemini-omni-1.1-flash):2026-08-27 正式 GA,取代 6/30 上線的 preview;閉源,按輸出秒數計費:360p $0.03、720p $0.10(預設)、1080p $0.15、4K $0.30(皆為 upscale);Artificial Analysis Text-to-Video Arena 無音訊榜第一(1322 Elo),含音訊榜第二(1237,落後 Wan3.0 的 1241);新增 scene extension(10 秒上下文、累積可延伸到 40 秒)與 first/last frame interpolation 控鏡
DeepSeek-V4-Flash-Vision-Exp:284B 總參數/13B 啟用參數 MoE,1M context、384K 最大輸出;定價與 V4-Flash 完全一致(Input $0.44/Output $1.32,尖峰;離峰對半);文字 agent benchmark 7 項中贏 6 項(DeepSeek 甚至以 59.3 分超越 Opus-4.8 的 58.0);多模態 agent 貼近 Opus-4.8(ApexBench 落後 2.9 分、ZeroBench 反超);每張圖片壓縮到最多 384 tokens、約 800×800 解析度上限,代價是細節辨識力
Breeze TTS 2:開放權重(Apache 2.0 程式碼/研究非商用權重授權),Artificial Analysis Provider Voices 榜單開放權重第一(1,215 Elo,領先 Fish Audio S2 Pro 90 分),Voice Design(Role Fit 78.02)與 Voice Direction(4.25 分)雙雙第一;TTFA p50 133.6ms/p95 163.3ms,RTF 0.32(H100);官方托管 API $34/百萬字元(比 Fish Audio S2 Pro 貴逾兩倍);支援 50 種語言,商用需另向 RESONIA, INC. 取得授權
Tencent Hy4 preview:770B 總參數/49B 活躍參數(MoE,78 層),Context Window 1,048,576 tokens;API 定價 input $0.834/output $2.501(每 100 萬 tokens,cache hit $0.042);Apache 2.0 開源權重已上 HuggingFace;163 位工程師盲測 2.99/4.00 些微領先 GLM-5.3(2.92)與 Kimi K3(2.94);第三方 BenchLM 綜合評分 79.2/100,全站排名第 7(228 個模型中);官方首度揭露模型參與自己的訓練優化與推理系統調校,吞吐量提升 31.8%
GLM-5.3-Flash:320B 總參數/18B 活躍(MoE),1M context/131K 最大輸出,支援文字+圖片+影片輸入,MIT 授權權重已上 HuggingFace;標準定價 input $0.15/output $0.50(每 100 萬 tokens,即日起到 9/9 五折 $0.075/$0.25),比同家 GLM-5.3 便宜約 9 成;Terminal-Bench 2.1 達 84.3(僅次 Opus 4.8 的 85.0),DeepSWE 1.1 從 GLM-5.2 的 46.2 跳到 63.4;前身「Ox Alpha」匿名期間曾拿下 OpenRouter 單週 token 占比第一
Wan3.0:單次生成長度從 Wan2.7 的 15 秒翻倍到 30 秒、最高 1080P、支援 doc/xls/ppt/pdf/md 文件與網頁當生成素材、定價 480P $0.05/720P $0.10/1080P $0.20(每秒),比 Google Veo 3.1 標準檔便宜約 50%,但改為閉源 API-only,且尚未經第三方獨立測試
Qwen3.8-Flash-Next:Qwen4 架構開放權重預覽、125B 總參數僅活躍 6B(另加 51B N-gram embedding)、262K 原生 context 可擴展到 1M、Qwen Community License 1.0(非 Apache 2.0)、官方 benchmark 顯示 Agentic coding(DeepSWE 1.1)58.7 分超越自家 27B 稠密模型與 397B 的 Qwen3.7-Plus、CoWorkBench 長時序辦公任務 73.9 分為表列最高,但目前仍無正式 API 定價與第三方獨立測試
GLM-5.3:沿用 GLM-5.2 base model、純 post-training 提升、1M context/128K 最大輸出、定價維持 $1.4 input/$4.4 output(每 100 萬 tokens)不變、Terminal-Bench 3.0 從 4.6% 跳到 28.3%(開源 SOTA)、CyberGym 漏洞挖掘 84.5% 超越表列所有閉源前緣模型,官方因此把權重釋出延後到安全評估完成(約 8/28)
Muse Spark 1.2:1M context window、input $1.25/output $4.25 per 1M tokens(與 1.1 相同)、AA Intelligence Index 57、GDPval-AA v2 Elo 大跳 260 分到 1631(全場第 5),搭配首款程式碼 agent Muse Code 主打長時間多 agent 協作
Grok 4.6:context window 500K tokens、input $2/output $6 per 1M tokens(與 4.5 相同)、AA Intelligence Index 61(追平 GPT-5.6 Sol Max)、GDPVal-AA v2 1753 Elo 全場最高,但 DeepSWE、Terminal-Bench 仍落後 GPT-5.6 Sol 與 Claude Fable 5
Muse Glimmer(HF:meta-models/Muse-Glimmer-30B):29.6B 參數、131K+ context、Apache 2.0 全開源,本地部署零 token 成本;MCP Atlas 75.5 分(同級 Gemma4-31B 54.2、Qwen3.6-27B 62.5)、SWE-Bench Pro 51.2 分領先同級,但 OSWorld-Verified、TerminalBench 2.1 落後 Qwen3.6-27B;4-bit 量化後 20GB 內可跑,RTX 5090 上 DFlash 投機解碼提速 3.1 倍
Gemini 3.7 Flash(API ID:gemini-3.7-flash):1M input/64k output context,input $0.75、output $3.75 per 1M tokens(優惠價至 2026-12-31,之後回到 $1.50/$7.50,與前代 3.6 Flash 同價);DeepSWE v1.1 65.3%(前代 48.6%)、AutomationBench 30.4%(前代 17.0%)、FrontierCode 1.1 43.6%,多項 agentic/企業自動化 benchmark 超越 Claude Sonnet 5 與 GPT-5.6 Terra