从"拼算力"到"拼数据":国家高质量数据集建设方案的战略深意
人工智能发展的竞争格局正在发生根本性转变——从早期的"拼算力"、中期的"拼算法",到如今进入"拼数据"的关键跃迁期。近日,国家印发《关于推进行业高质量数据集建设行动的实施方案》,以六大行动系统部署数据要素市场化改革新路径。这一顶层设计的出台,不仅关乎技术路线选择,更揭示了我国在人工智能发展范式上的战略转向。
数据:从"潜力资源"到"关键生产资料"的跃迁
《方案》在国家层面首次系统界定了行业高质量数据集的核心内涵与分类标准,明确了其作为"可直接用于人工智能模型开发训练"的基础性资源地位。这一界定意义深远,意味着数据集正式从传统的成本项和信息记录,跃升为AI时代的关键生产资料。
当前,通用大模型技术迭代趋于平稳,向垂直行业的深度落地已成为必然选择。然而,高质量行业数据供给不足正成为制约产业落地的最大瓶颈。数据"来源分散、质量参差、覆盖不足"的供给短板,以及"合规风险高、获取成本高"的流通痛点,严重阻碍了模型性能优化与产业闭环形成。
《方案》提出的"四个一批"目标——建成一批国际领先的高质量数据集、打造一批标杆性典型应用场景、培育一批具有核心竞争力的创新主体、形成一批统一规范的标准工具体系——旨在打通从数据供给到价值释放的全链条堵点,构建"场景牵引-数据供给-模型迭代-应用深化"的协同演进生态。
六大行动:破解产业痛点的系统解法
《方案》以覆盖数据全生命周期的系统思维,构建了闭环管理推进体系。其中三个维度的创新突破尤为关键,为破解行业痛点提供了根本遵循。
在供给与加工维度,"强基扩容"与"标注攻坚"两大行动精准契合人工智能向多模态、具身智能演进的技术趋势。一方面拓宽数据供给渠道,覆盖传统优势行业与前沿新兴领域;另一方面推动数据标注从"人力密集型"向"知识密集型"转型升级,推广智能化标注模式,建立行业专家深度参与机制。
在质量与应用维度,"提质增效"与"应用赋能"两大行动直击数据建设与应用脱节的核心痛点。创新性提出的"数据飞轮"应用闭环,以实际应用需求牵引数据供给优化,以高质量数据赋能驱动模型迭代升级,实现数据价值随模型迭代的指数级增长。
在治理与价值维度,"管理服务"与"价值释放"最具制度突破性。探索数据持有权、使用权、经营权"三权分置"的权益制度,创新性提出以词元为基础的价值体系和交易模式,推动商业模式从基础数据包销售向API调用、全栈服务跃升。这从根本上为数据要素定价难、流通难提供了破题路径。
上海实践:先行先试的经验与方向
上海作为全国数字经济与人工智能发展的前沿阵地,已率先启动高质量数据集建设先行先试。2025年,全市10家属地单位入选国家高质量数据集先行先试试点,5个案例获评国家典型案例;同步部署市级先行先试工作,累计遴选61个重点项目,覆盖工业、医疗、金融、农业、交通、外贸等核心领域。
未来,上海将重点抓好六个方面:加快完善基础能力、扩大行业数据供给、聚焦重点领域建设、促进技术转化、培育产业生态、强化保障机制。其中,多模态采集、智能标注、数据合成、融合增强等关键环节的技术攻关,以及数据集与模型、软件、硬件协同创新,将成为突破重点。
数据要素市场化的中国方案
《方案》的出台,标志着我国数据要素市场化改革迈入"高质量供给"与"深度价值释放"并重的新阶段。这不仅是一场技术变革,更是一场生产关系的重塑——数据从被消耗的资源转变为可增值的资产,从静态的信息记录转变为动态的价值载体。
对教育与研究机构而言,这意味着研究范式需要从"算法中心"转向"数据-算法"双轮驱动。对政府与产业服务相关者而言,这要求构建全新的治理框架和价值分配机制。高质量数据集建设,本质上是为人工智能时代构建新型基础设施,其战略意义不亚于工业时代的"铁公基"。
数据驱动的人工智能发展格局正在形成,谁掌握了高质量数据,谁就掌握了智能时代的主动权。《方案》的全面实施,将推动我国在全球人工智能竞争中占据更有利的位置,为千行百业的数字化转型提供坚实的数据底座。这不仅是技术路线图,更是国家竞争力的战略布局。
特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。



