眼下,人工智能(AI)技術的快速迭代與規模化應用,催生了數據領域的諸多新賽道。高質量數據集構建、精細化數據標注、數據智能分析平臺等新賽道蓬勃興起,為產業鏈上下游企業提供了豐富的創新機遇。
業內人士表示,人工智能的飛速發展對數據標注也提出了更高要求,數據標注產業正經歷著深刻變革,純人工時代已漸行漸遠,取而代之的是知識密集型和技術驅動型并存的新態勢,推動產業發展從“量”向“質”躍遷。
在北京石景山區,京西數據標注基地將海量、雜亂的原始數據,變成通用大模型和行業AI看得懂、用得好的“高純度燃料”。這個由中國電信北京公司聯合多方打造的開放式數據服務中樞,不僅提供圖像、語音、3D點云等多模態精細化標注,還引入智能化標注工具平臺,全面提升標注質量與效率。
中國電信北京公司大數據專家李翔對記者表示,數據標注常被外界認為是“數字流水線上的打工人”,即依靠大量人工進行簡單的框選與標記。在大模型時代,粗放模式早已無法適應極其復雜的場景需求。目前,中國電信北京公司系統布局四大數據標注基地,將數據加工升級為“現代化精煉廠”,還聯合北京郵電大學共建“行業數據智能標注聯合實驗室”,針對大模型數據集海量、多源、多模態的特點,構建起從采集、存儲到加工的全流程治理體系。
業內常說,“高質量的數據決定人工智能的上限”。來自國家數據局的信息顯示,截至今年6月,全國已建成高質量數據集超12萬個,總體量超過1565拍字節(PB)。人工智能在千行百業的深度落地,促使數據生產方式從粗放式采集向精細化、專業化加工演進。
作為AI數據行業的上市公司,北京海天瑞聲科技股份有限公司表示,數據標注產業正從“勞動密集型”向“技術密集+知識密集型”加速轉型。面向思維鏈數據、多模態數據、行業數據、具身智能數據、智能體應用數據等新一代需求,高質量數據集建設正迎來全新技術與場景挑戰。企業正聚焦全球人工智能數據前沿技術,攻關多模態數據與智能標注關鍵技術。
賽智產業研究院數據產業研究所所長陳文靜對記者表示,數據生產方式向精細化、專業化加工演進,這是技術迭代、產業剛需同頻共振的結果。一方面,多模態大模型、具身智能等前沿技術對數據鮮活度、真實性、高知識密度提出嚴苛標準;另一方面,AI賦能千行百業,垂直場景專屬數據、專業標注的供給缺口持續擴大,倒逼企業深挖數據增值空間。精細化數據標注告別低價人力外包,轉向“模型預標注+專家校準”模式,可滿足多模態、思維鏈等高階標注需求;數據智能分析平臺作為效率底座,集成脫敏、質檢、溯源等功能,可實現規模化、標準化加工。
政策利好將進一步助推數據產業新興賽道的發展。國家數據局日前印發的《關于推進行業高質量數據集建設行動的實施方案》,在標注方面提出,加強數據標注領域科技創新,強化自動化工具和平臺的研發與應用,發展“模型預標注+人工校準”“人工標注+模型檢驗”“模型預標注+模型檢驗”等智能化標注服務,全面提升數據標注水平。
此外,北京、廣東、湖北、蘇州等地通過直接獎勵、數據券、語料券等方式,降低數據采集、加工、標注、購買和使用成本,旨在形成“場景牽引數據、數據驅動模型”的良性循環。
“數據喂養模型、模型支撐智能應用、應用中又產生新數據,源源不斷回流優化模型,數據和智能形成相互循環轉化的良好生態。”浪潮數據董事長、首席科學家張東表示。
“產業鏈上下游企業迎來多元發展機遇。”陳文靜表示,上游數據源持有方可盤活存量數據,參與公共數據運營與行業數據集共建;中游企業聚焦細分賽道,打造稀缺數據產品與一體化平臺,搶占高附加值市場;下游模型廠商、集成商可依托優質數據縮短研發周期、提升項目競爭力;配套服務商則可切入交易撮合等環節,分享生態紅利。
清華大學計算社會科學與國家治理實驗室執行主任、教授孟慶國表示,要進一步培育行業高質量數據集市場。當前數據集市場面臨供需信息不對稱、商業模式不成熟、付費意識薄弱等突出問題。要打通供需對接渠道,常態化舉辦供需對接活動,提升匹配效率。創新商業模式,發展訂閱、定制等多元服務形態,探索詞元交易等新型定價機制,讓數據集的價值“看得見、算得清、付得出”。(記者 郭倩)
轉自:經濟參考報
【版權及免責聲明】凡本網所屬版權作品,轉載時須獲得授權并注明來源“中國產業經濟信息網”,違者本網將保留追究其相關法律責任的權力。凡轉載文章及企業宣傳資訊,僅代表作者個人觀點,不代表本網觀點和立場。版權事宜請聯系:010-65363056。
延伸閱讀