用 arena.ai 排行榜挑 AI 影片模型:怎麼讀分數、怎麼定期回訪,以及它讀不出來的事
arena.ai 的 image-to-video 與 video-edit 兩張榜,是目前最接近「盲測公投」的模型比較表。本文拆解它的 Bradley-Terry 評分機制、教你先看信賴區間再看名次,並說明為什麼榜首不等於最適合你的片。
年初敲定的那套製程,到年底很可能已經是次佳解。
AI 影片模型的汰換是以「月」為單位的。一支短片從企劃到成片動輒三、四個月,等你剪完,當初選的模型往往已經被同一家公司的下一版、或半路殺出的新對手比下去。真正的問題從來不是「要不要換」,而是「怎麼知道該換了,以及該換成什麼」。
arena.ai 的排行榜就是拿來回答這件事的儀表板。它不是廠商的規格表,也不是自媒體的開箱心得,而是把數十萬到數百萬筆匿名盲測投票解成一條分數軸。這篇文章講三件事:三張影片榜各自在測什麼、分數是怎麼算出來的、以及——這部分最重要——它算不出來的是什麼。
本文引用的所有數字都是 2026-09-14 擷取的快照。你讀到時幾乎一定已經變了,這正是本文的重點:排行榜的用途是排程回訪,不是背下名次。
一、先搞清楚三張榜各自在測什麼
Arena 把影片相關的評測拆成三張獨立的榜,對應影視製程裡三個完全不同的環節。挑模型之前,先確定你要解的是哪一個問題。
| 排行榜 | 你餵給模型什麼 | 對應製程環節 |
|---|---|---|
| Text to Video | 純文字提示 | 分鏡草稿、概念驗證、抓鏡頭感覺 |
| Image to Video | 關鍵影格+文字 | 主力工序:讓定好的畫面動起來 |
| Video Edit | 既有影片+修改指令 | 後製補救:改光、換景、去穿幫、接長度 |
對絕大多數走「圖像模型產關鍵影格 → 圖生影片 → 剪接台拼成片」這條路的創作者,Image to Video 才是主戰場。文生影片的榜好看、討論度高,但在一支要求美術統一的片裡,你幾乎不會讓模型自己決定畫面長什麼樣。
Video Edit 則是三張裡規模最小、也最不穩定的一張。截稿時它只有 10 個模型、累計 27,930 票(頁面標示資料日期 2026-08-26);同時期 Image to Video 是 47 個模型、1,906,002 票(資料日期 2026-09-02)。票數差了將近七十倍,代表這兩張榜的可信度根本不在同一個量級。
截稿當下的快照
Image to Video 前十(資料日期 2026-09-02):
| # | 模型 | 開發者 | 分數 | 票數 |
|---|---|---|---|---|
| 1 | minimax-h3 | MiniMax | 1497±6 | 36,137 |
| 2 | gemini-omni-1.1-flash | 1488±11 | 3,732 | |
| 3 | wan3.0 | 阿里巴巴 | 1481±16 | 1,401 |
| 4 | dreamina-seedance-2.5-720p | 字節跳動 | 1478±10 | 6,725 |
| 5 | dreamina-seedance-2.0-720p | 字節跳動 | 1477±8 | 113,611 |
| 6 | gemini-omni-flash | 1462±6 | 71,006 | |
| 7 | grok-imagine-video-1.5-720p | SpaceXAI | 1456±5 | 119,111 |
| 8 | flux-3-video-20260811 | Black Forest Labs | 1449±6 | 20,601 |
| 9 | happyhorse-1.0 | Alibaba-ATH | 1442±10 | 70,682 |
| 10 | wan2.7-i2v | 阿里巴巴 | 1428±5 | 72,878 |
開發者那一欄值得先記住:前十名裡有六個出自中國團隊——MiniMax(Hailuo 海螺的開發商)、阿里巴巴(Wan)、字節跳動(Seedance)。這件事會在第四節回頭談。
Video Edit 全榜(資料日期 2026-08-26):
| # | 模型 | 開發者 | 分數 | 票數 |
|---|---|---|---|---|
| 1 | wan3.0 | 阿里巴巴 | 1414±26 | 463 |
| 2 | dreamina-seedance-2.5-720p | 字節跳動 | 1410±26 | 429 |
| 3 | minimax-h3 | MiniMax | 1392±19 | 962 |
| 4 | gemini-omni-flash | 1367±15 | 2,109 | |
| 5 | dreamina-seedance-2.0-720p | 字節跳動 | 1365±14 | 3,852 |
| 6 | happyhorse-1.0 | Alibaba-ATH | 1307±14 | 3,116 |
| 7 | grok-imagine-video | SpaceXAI | 1258±10 | 13,724 |
| 8 | kling-o3-pro | KlingAI | 1255±11 | 7,540 |
| 9 | kling-o1-pro | KlingAI | 1197±10 | 10,542 |
| 10 | runway-gen4-aleph | Runway | 1182±9 | 9,818 |
先別急著抄第一名。下一節會說明,這兩張表裡有好幾組「名次不同但實際上分不出高下」的模型。
二、分數是怎麼算出來的
Bradley-Terry:把兩兩對決還原成一條強度軸
Arena 的做法是:同一個提示詞同時丟給兩個匿名模型,使用者看完兩支影片後選一個。官方說明寫得很清楚——模型在投票期間保持匿名以消除品牌偏見,投完才揭曉名稱,而且只有在匿名狀態下投的票才算進正式排名。
這些兩兩對決的結果,交給 Bradley-Terry 模型解出每個模型的「強度」。Arena 自己的說法是,選這套是因為它在成對比較上久經驗證、能用全部的票一次算出效率高的評分,而且容易再擴充吃進額外特徵。
它跟大家熟悉的 Elo 很像,但有個關鍵差別:Elo 是一場一場加減分,路徑依賴;Bradley-Terry 是把所有票一次丟進去全域求解。 這代表新票進來時,整張榜的分數會一起重算,不會因為某個模型「早上榜、賺到早期分數」而佔便宜。
分數差要怎麼換算成勝率
分數落在 Elo 式的 400 分尺度上。你只要記住一張對照表:
| 分數差 | 預期勝率 |
|---|---|
| 20 分 | 約 53% |
| 50 分 | 約 57% |
| 100 分 | 約 64% |
| 200 分 | 約 76% |
拿上面的 Image to Video 來算:榜首 minimax-h3(1497)對第四名的 Seedance 2.5(1478)只差 19 分,預期勝率 52.7%。也就是說,你拿同一張關鍵影格分別丟給這兩個模型,一百次裡大約 53 次投票者會選榜首那支——這距離「碾壓」非常遠,幾乎就是擲硬幣。
反過來看榜尾:Image to Video 最低約 997 分,跟榜首差了 500 分,那才是貨真價實的世代差距。
± 那個數字比名次重要
分數後面的 ±26、±6 是信賴區間。兩個模型的區間重疊,就表示現有票數還不足以判定誰比較強。
Video Edit 的前三名是教科書級的例子:
- wan3.0:1414±26 → 1388〜1440
- Seedance 2.5:1410±26 → 1384〜1436
- minimax-h3:1392±19 → 1373〜1411
三條區間疊成一片。這三個模型在統計上是並列第一,只是因為排行榜必須印出一個順序,才被排成一、二、三。而 wan3.0 在這張榜只有 463 票,Seedance 2.5 只有 429 票——這種票數下的名次,下個月翻盤是常態而非意外。
順帶一提,區間不重疊也不等於差很多。Image to Video 的榜首(1497±6)與第四(1478±10)區間確實沒有交集,統計上「確實有差」,但實際勝率只有 52.7%。統計顯著 ≠ 實務上有感,這兩件事要分開讀。
三、這套機制的客觀性,強在哪裡
值得肯定的地方要講清楚,才知道它的界線在哪:
- 盲測,而且只採計盲測票。 揭曉後補投的票不進排名,品牌濾鏡被擋掉一大半。這一點就足以讓它勝過絕大多數自媒體評測。
- 同題對決。 兩個模型吃的是同一個提示詞,不存在「我幫 A 寫了比較好的 prompt」這種偏差。
- 票權平等、全域求解。 沒有編輯部加權,沒有廠商買榜位,所有票一起進 Bradley-Terry。
- 不確定性是公開的。 信賴區間直接印在榜上,而不是只給一個假裝很精準的數字。頁面另外提供對戰場次矩陣與對各對手的勝率,可以逐對拆開看。
- 可以自己篩。 License 篩選器能把榜切成 Proprietary 與 Open Source(榜上也會出現 Community License 這類介於中間的標示),分數區間也能拉。另有 Models/Labs 兩個分頁,後者是以開發商為單位看整體表現。
這些設計加起來,讓它成為目前最接近「公開、可重複、不受行銷預算左右」的模型比較表。但客觀不等於全面。
四、局限性:榜首不等於最適合你的片
1. 它測的是「五秒鐘的第一眼」,不是「一部片的成片率」
投票者看到的是兩支短片,在幾秒內決定哪支比較好。這種情境會系統性地獎勵高飽和、大動態、戲劇性打光——也就是預告片與廣告的語言。
而一支敘事短片要的常常是相反的東西:一顆不搶戲的長鏡頭、一個能重複命中同一張臉的模型、一段可以接得上前一顆的光線。這些特質在五秒鐘的兩兩對決裡拿不到分,甚至會扣分。
2. 投票池的臉孔偏誤:Seedance 2.5 就是最好的例子
Arena 的票來自全球社群,提示詞也由社群自己輸入。這代表投票樣本的人種分布、題材分布、審美偏好,沒有理由等於你的片的分布。
以 Seedance 2.5 為例。它在 Image to Video 是第四名(1478±10),分數不是最高的;但在華語 AI 影視社群的實務回饋裡,它在亞洲臉孔的一致性與自然度上是另一個量級的存在——第三方評測普遍指出 2.5 在人物膚色質感、恐怖谷的消除、以及雙人物場景中的外貌一致性與動作互動穩定度上有明顯進步,這一代的升級重點本來就放在時長、穩定性、參考輸入與影片編輯:角色能跨鏡頭維持一致、動作能指定時間點、出錯時可以只改一小段而不必整支重生成。
對一支台灣的劇情短片來說,「同一張亞洲臉能不能撐過三十顆鏡頭」這件事的權重,遠高於「單鏡頭的第一眼誰比較炫」。但排行榜只有一條分數軸,它把這兩件事壓成同一個數字。
3. 運鏡語言也有口音
同樣的落差出現在鏡頭調度上。歐美訓練資料為主的模型,預設的鏡頭習慣偏向大幅度、明確動機的運動:快速推軌、環繞、手持晃動、誇張的景深變化。這在對決裡很吃香,因為「看起來有在動」很容易贏過「看起來很穩」。
而 Seedance 這類以華語圈影視素材為訓練大宗的模型,運鏡習慣明顯更接近亞洲文藝片的細膩感:慢速的呼吸式推移、克制的橫搖、留白比較多的構圖節奏。如果你要拍的是這種調性,榜上分數高的模型反而要花更多提示詞去「按住」它。
這一段是編輯部與創作者社群的實務觀察,不是 Arena 的評測結果——事實上這正是重點:這類差異在現行的評分機制下,結構上就測不出來。 別把它當定論,請用下一節的方法自己驗一次。
4. 榜上的模型名稱不等於你買得到的規格
注意榜上寫的是 dreamina-seedance-2.5-720p、grok-imagine-video-1.5-720p。那是 720p 的變體。 你在商用平台上實際跑的 1080p 或 4K 版本,畫質、時長上限、甚至運動特性都可能不同。開源模型更是如此:本機部署的 Wan 跟雲端 API 版本在取樣步數、解析度與後處理上往往不是同一回事。
看完榜,還是要回到你真正會付錢的那個介面去測。
5. 票數少的新模型會出現「曇花第一」
新模型剛上榜時票少、區間寬,很容易衝到高位;等票數堆上去,分數常會回落。前面的 wan3.0(Video Edit 榜 463 票、±26)就處在這個階段。
另一個方向的風險是針對榜單過擬合:廠商知道 Arena 的常見題型長什麼樣,可以往那個方向調校。Arena 自己也意識到這件事,官方頁面就掛著一篇談排行榜對抗性攻擊與緩解的論文(ICML 2025 oral)。
6. 一個分數收不下的那些欄位
下面這些全部影響成片,全部不在榜上:
- 跨鏡頭角色一致性:靠的是參考圖、首尾幀、角色卡,不是單次生成的畫質
- 重生成命中率:真實成本是「抽卡次數 × 單價」,畫質第一但要抽十次,未必划算
- 可控性:seed 能不能固定、鏡頭指令遵不遵守、能不能只改局部
- 對嘴與聲音:唱段、對白的同步品質
- 時長與解析度上限
- 商用授權與內容審查:不同產地的模型對人物肖像、暴力、政治符號的容忍度差很多
- 排隊時間與併發數:趕期的片,這一條可能比畫質更致命
Kling 與 Runway 在 Video Edit 榜上分數落在後段,但它們在可控性、流程整合與商用條款上的成熟度,是分數欄位完全反映不出來的。同理,Veo 與 Sora 在文生影片榜上被新模型超車,不代表它們在原生聲音或長段落調度上的優勢消失了。
五、操作步驟
Step 1:先確定你要換的是哪一個環節
把你的製程拆成「文生影片/圖生影片/影片編輯」三段,只去看對應那張榜。不要用文生影片的名次去決定你圖生影片要用什麼——那是兩個不同的排行榜、不同的能力。
Step 2:讀榜的順序是票數 → 區間 → 名次
先看票數:四位數以下的一律當作「參考值」。再看 ± 區間:把所有跟榜首區間重疊的模型圈成一組候選,這一組在統計上是並列的。最後才看名次,而且名次只用來決定「先試誰」。
Step 3:用 License 與分數區間砍掉不可能的選項
如果你需要本機部署、要跑 LoRA 或自訂工作流,就把 License 篩成 Open Source——這時榜長得完全不一樣。如果你只用雲端服務,反過來篩 Proprietary。再用分數區間把差距 100 分以上(勝率 64% 以上)的直接排除。
注意榜上還有 Community License 這一類,授權條款通常帶使用限制(例如營收門檻或用途條款)。商用案子要在這一步就去讀條款,不要等到成片才發現不能用。
Step 4:進 Battle 模式,用你自己的素材投 20 票
這是最多人略過、卻最有價值的一步。Arena 的對戰模式讓你輸入自己的提示詞,看兩支匿名結果再投票。用你真正要拍的題材去投二十次:你的角色設定、你的打光、你的運鏡描述。揭曉後記下誰贏——這二十票的參考價值高過整張榜,因為分布就是你的分布。
Step 5:建一組固定的三題自測
長期要比較,就要有不動的尺。建議固定三題,每次評估新模型都跑同一組:
- 一致性題:同一張角色參考圖,生成三個不同景別,看臉會不會跑掉
- 調性題:一段你的典型運鏡描述(例如慢速推鏡+自然光),看模型的預設口音離你多遠
- 修補題:一段有瑕疵的既有素材,要求局部修改,看它會不會順手改掉別的地方
把每次的結果存成資料夾,檔名寫上模型與日期。半年後這份自建資料比任何排行榜都準。
Step 6:排進行事曆,每月回訪一次
把三張榜加進書籤,設一個每月的提醒。回訪時只問三件事:有沒有新模型進前五?現有候選的區間有沒有拉開?我正在用的那個掉了幾名? 任何一題是「有」,就重跑 Step 5 的三題自測。
換模型不是換一顆鏡頭,是換一整段製程——調過的提示詞、抓好的參數、建立的角色卡可能都要重來。所以要定期回訪,但不要每次看到新第一名就跳船。
六、把排行榜當雷達,不要當裁判
Arena 這套機制最誠實的地方,是它把不確定性印在分數旁邊。它告訴你的是「社群在盲測條件下比較喜歡哪一支」,不是「哪一個模型最適合你的片」。 這兩個問題差很遠。
正確的用法是:用排行榜發現候選,用自己的三題自測做決定。 榜負責告訴你「這個月有東西變了」,決定權留在剪接台上。
Seedance 2.5 的例子值得記住——它不是榜首,但對某些人來說它就是正確答案。排行榜沒有說錯,只是它問的問題不是你的問題。
常見問題
分數差多少才算真的有差?
答:先看區間有沒有重疊,重疊就當成並列。不重疊時再看分數差:差 20 分約等於 53% 勝率,實務上感覺不到;差 100 分(約 64% 勝率)才算明顯;差 200 分以上(約 76%)是世代差距。統計上顯著跟實務上有感是兩件事,不要把「第一名」讀成「壓倒性」。
開源模型分數比較低,是不是就不用看?
答:恰好相反,要先按 License 篩選再讀。開源模型的價值在可部署、可微調、可接進自訂工作流,這些能力不會出現在分數欄位裡。截稿時 Wan 系列在 Image to Video 與 Video Edit 兩張榜都擠進前幾名,本身也說明開源與閉源的畫質差距正在收斂。
既然榜有這麼多局限,那還要看嗎?
答:要,但只當雷達用。它的不可取代之處是「大規模、盲測、同題」——這三件事你自己做不到。用它來發現有新模型出現、或你現在用的那個開始落後,然後回到自己的三題自測做最後判斷。
多久回訪一次才合理?
答:每月一次是合理起點,開新案子前再加看一次。不建議更頻繁——新模型初期票數少、區間寬,一週內的名次變動大多是雜訊;也不建議更久,這個領域半年就是一個世代。
Seedance 2.5 到底該不該用?
答:如果你的片以亞洲臉孔為主、追求細膩的運鏡與文藝調性,它值得放進前三順位測試,即使分數不是榜首。但不要憑本文的說法就直接採用——用 Step 5 的三題自測跑一次,特別是一致性題,答案會比任何評測都可靠。
資料來源
- arena.ai:Image to Video 排行榜、Video Edit 排行榜、Text to Video 排行榜(分數與票數擷取於 2026-09-14,頁面標示資料日期分別為 2026-09-02、2026-08-26、2026-09-04)
- arena.ai:FAQ、How it works(評分機制、匿名投票規則)
- Seedance 2.5 第三方評測:Seedance 2.5 完整評測:30 秒 AI 影片、角色一致性與 4K 生成能力實測、鈦媒體:Seedance 2.5 來了,字節能打敗自己嗎?
- 亞洲臉孔一致性與運鏡調性的判斷屬編輯部與創作者社群的實務觀察,非 Arena 評測結果,請以自身測試為準。