當Sora 2、可靈3.0、Veo 3.1等前沿視頻生成模型加速迭代時,一個被行業刻意回避的問題正在浮出水面——訓練數據從哪來?
OpenAI在Sora 2的系統卡里僅用41個字描述訓練數據來源,未披露任何數據集名稱與規模。同期,NVIDIA Cosmos亮出2000萬小時、9000萬億token的訓練規模,騰訊HunyuanVideo公開了億級切片的訓練流程——前沿模型跑得越快,"用什么訓的"反而越說不清。
多模態數據集服務商藝恩在近日發布的行業觀察中指出:對任何一家正在做視頻生成或世界模型的公司來說,真正的問題不是"下一代模型要多大",而是"下一批訓練數據從哪兒來"。
瓶頸一:公開數據正在見底
Epoch AI在2024年ICML論文中估算,經質量修正后的公開人類文本約300萬億token,按當前消耗速度將在2026至2032年間用完。視頻領域雖無等價研究,但可反向推算:NVIDIA Cosmos的2000萬小時訓練語料,大致相當于YouTube全球27天的全部上傳量。
公網視頻不是不夠多,是不夠好。質量、密度、信號均不足以支撐下一代模型。Meta V-JEPA 2訓練用了"100萬小時以上互聯網視頻加少量交互數據"——前一項是已做到的規模,后一項才是真正的瓶頸。

圖 1 · 前沿視頻模型訓練數據公開披露度對比
瓶頸二:4D與多視角數據,公網里幾乎沒有
世界模型陣營已將此點明。Meta LeCun在V-JEPA 2論文中指出,"以觀察為主學習世界"需結合互聯網視頻與交互數據;斯坦福Fei-Fei Li更直言:"空間智能的數據都在我們腦子里,不像語言可直接獲取。"
目前公開4D數據集規模有限——上海AI Lab的DNA-Rendering提供6750萬幀多視角語料,Google Stereo4D挖出11萬個4D片段——相比千萬小時級2D視頻,小兩到三個數量級,且高度集中在人體、自動駕駛、室內機器人三個窄域。
資本已用腳投票。2026年初,Fei-Fei Li的World Labs獲10億美元融資,LeCun創立的AMI Labs完成10.3億美元種子輪,兩筆合計20億美元,核心押注均指向——為"理解物理世界"準備數據。

圖 2 · 視頻訓練數據的三個結構性缺口
瓶頸三:電影級數據開始被定價
帶導演意圖的視頻正在成為稀缺資源。阿里Wan 2.2按光線、色調、構圖等幾十維標注訓練數據;Google Veo 3紅隊報告顯示其輸出"偏電影級,常出現切鏡與戲劇性運鏡"——背后必有高占比電影級語料支撐。
2025年12月,迪士尼以10億美元入股OpenAI,200余個IP角色被納入Sora生成范圍,雖僅授權"輸出生成權"而非"訓練權",但這是好萊塢與視頻AI首次以IP+現金+股權方式將內容擺上談判桌。
國內方面,2025年1月愛奇藝起訴MiniMax的版權案仍在審理,索賠僅10萬元,但作為中國首例視頻平臺訴AI模型案,信號意義遠超金額本身。
藝恩判斷:下一步不在公網
藝恩在觀察中給出明確判斷:"再加10倍數據"的方向,不在公網,而在三條路——
第一條是仿真合成路線,以NVIDIA Cosmos為代表,用物理仿真與機器人采集數據替代真實視頻;
第二條是精標注路線,以Wan 2.2為代表,給現有視頻疊加電影級結構化標注;
第三條是IP采購路線,以迪士尼-OpenAI為代表,真金白銀買入版權清晰的優質內容。
三條路有一個共同特征:垂類、有授權鏈、有結構化標注。 藝恩認為,這已不是數據工程問題,而是戰略采購問題——決定它的不是工程團隊的吞吐能力,而是組織能否搭出一條"合規可溯源+多模態標注+持續更新"的供給體系。

圖 3 · 2025-2026 圍繞「視頻訓練數據」的資本與合規節點
藝恩方面表示,其在影視綜藝、社媒、電商領域有超過10年的垂類數據積累,包括2.3B+條垂類視頻資產、1.2M+部影視綜藝授權片,以及多機位與4D采集能力和五維稠密標注體系。在其看來,行業面臨的不是"數據用完了",而是"數據該被重新定義"——下一代視頻模型需要的不是更多公網視頻,而是更結構化、更可溯源、更接近真實物理世界的垂類語料。
轉自:中國經濟新聞網
【版權及免責聲明】凡本網所屬版權作品,轉載時須獲得授權并注明來源“中國產業經濟信息網”,違者本網將保留追究其相關法律責任的權力。凡轉載文章及企業宣傳資訊,僅代表作者個人觀點,不代表本網觀點和立場。版權事宜請聯系:010-65363056。
延伸閱讀