為AI“添燃料”——全國高質量數據集超12萬個,體量突破1565PB


    中國產業經濟信息網   時間:2026-07-31





      在7月28日國家數據局舉行的2026中國國際大數據產業博覽會新聞發布會上,國家數據局副局長余英披露了一組關鍵數據:截至今年6月,全國已建成高質量數據集超12萬個,總體量超過1565拍字節(PB),高質量數據集正成為人工智能快速發展的關鍵“燃料”。


      國家數據局副局長余英介紹,國家數據局從成立伊始就高度重視數據要素賦能人工智能發展工作,堅持系統謀劃、協同推進,不斷完善高質量數據集的建設、評測、管理體系的構建,持續推進數據要素賦能人工智能創新發展,經過這幾年的持續努力,目前在全社會已形成了“人工智能+”到哪里,高質量數據集建設和應用就到哪里的良好氛圍。


      一是高質量數據集建設規模快速擴容。國家數據局會同高質量數據集建設鏈主單位、先行先試單位,圍繞科學研究、工業制造、農業農村、具身智能、低空經濟等領域,分類推動高質量數據集建設。截至2026年6月份,全國已建成高質量數據集超12萬個,總體量超過1565拍字節。可以說,高質量數據集已經成為人工智能快速發展的關鍵“燃料”。同時,國家數據局也在加快推進更多高質量數據集的建設。


      二是高質量數據集管理規范體系日益健全。國家數據局指導全國數標委研制《高質量數據集建設指南》《高質量數據集格式要求》《高質量數據集分類指南》等5項國家標準,初步構建起“數據質量檢測+基準模型驗證”相結合的高質量數據集質量檢測方法和工具,已對12個數據集、超4563萬條數據完成檢測,為數據集的可信可用提供了保障。


      三是高質量數據集流通利用生態有序構建。在今年4月第九屆數字中國建設峰會上,國家數據局發布上線了國家數據集管理服務系統,構建了“物理分散、邏輯集中”的數據集資源目錄統一管理機制。截至6月底,系統已認證各類供需主體578家,上架數據集1433個,促進數據集供需主體有序對接,數據集流通利用生態加速形成。


      四是鼓勵基于詞元應用的商業模式創新。探索詞元交易等新型交易模式,培育“為優質數據付費”的市場共識。深化詞元應用與工業、醫療、金融等領域的深度融合,助力人工智能應用規模化落地,推動形成以模型應用牽引數據供給、以數據賦能模型迭代的良性供需互動,形成“數據飛輪”效應。


      “下一步,我們將持續推進行業高質量數據集建設,深入實施數據賦能人工智能六大專項行動,推動行業高質量數據集建設推廣與‘人工智能+’同頻共振、互促共進強化數據賦能人工智能創新發展。”余英表示。(記者 曹雅麗)


      轉自:中國工業報

      【版權及免責聲明】凡本網所屬版權作品,轉載時須獲得授權并注明來源“中國產業經濟信息網”,違者本網將保留追究其相關法律責任的權力。凡轉載文章及企業宣傳資訊,僅代表作者個人觀點,不代表本網觀點和立場。版權事宜請聯系:010-65363056。

    延伸閱讀

    ?

    版權所有:中國產業經濟信息網京ICP備11041399號-2京公網安備11010502035964

    www.色五月.com