聚焦2026数博会 | 深圳大学电子与信息工程学院院长丁文华:数据集是AI发展的底座

2026-08-29 10:34    来源:当代先锋网

8月28日下午,在中国国际大数据产业博览会组委会主办,中国信息通信研究院、中国移动通信集团承办的“高质量数据集和数据标注”主题交流活动上,深圳大学电子与信息工程学院院长丁文华作题为《支撑人工智能发展的数据集建设思考》的主旨演讲。

他提出,数据集是人工智能技术迭代升级的核心底座,更是当前制约AI,尤其是具身智能规模化落地的关键因素。

他从人工智能核心要素、大模型能力现状、AIGC发展趋势、训练数据缺口、具身智能发展痛点等多个维度,系统剖析了当前人工智能产业的发展现状与核心短板。

深圳大学电子与信息工程学院院长丁文华。 闻双 摄

他表示,模型参数、训练数据、算力资源是支撑人工智能发展的三大核心要素,三者协同决定AI技术的迭代速度与落地能力,其中高质量训练数据是技术落地应用的核心根基。

针对当前人工智能的能力边界,丁文华结合行业实测数据作出详细解读。在业内主流的11项人工智能能力测试中,AI已在图像分类、视觉推理、英语理解、中等阅读理解等8个领域超越人类水平,智能化能力持续迭代突破。但在智能体多模态计算机应用、高阶数学推理、自主软件工程3个核心领域,AI能力仍未达到人类基线水平,智能综合应用、自主创新能力存在明显不足。与此同时,备受关注的具身智能技术,也因训练数据缺失陷入发展瓶颈。

丁文华说,具身智能在受控仿真场景中表现优异,短期任务完成成功率已接近90%。但落地真实生活场景时能力大幅下滑,日常家务类任务部分完成率仅25%至26%,完整任务全程成功率不足13%,场景适配、自主决策、动态交互能力短板显著。

“高质量数据集和数据标注”主题交流活动。闻双 摄

他进一步解释,具身智能的训练逻辑与传统大模型存在本质差异,其训练高度依赖多维度、全流程的持续交互轨迹数据,涵盖环境感知、设备自身状态、力觉反馈、动作痕迹、精细化任务标注等多元信息,对数据的真实性、连续性、场景化要求极高。

他表示,当前全球具身智能交互轨迹数据总时长仅十万至几十万小时量级,而业界共识显示,想要实现具身智能多场景、规模化商用落地,所需训练数据时长至少达到千万小时级,甚至需要突破亿小时量级,行业数据缺口巨大。

针对数据集建设短板与行业缺口,丁文华提出多方协同的破局思路。他表示,后续可依托高校开源数据、企业私有数据有序开放、第三方数据机构专业化生产、国家级数据平台统筹建设四大路径,整合全行业资源、打通数据壁垒,高效补齐具身智能训练数据短板,大幅缩短千万小时级高质量数据集的建设周期,为人工智能尤其是具身智能产业的长远发展筑牢数据底座。

天眼新闻记者 鲍贝贝

编辑 郭立

二审 管云

三审 岳振