热点科技|2026 中国国际大数据产业博览会现场观察

2026 数博会本原智数展位现场
如果把过去几年的 AI 竞争概括成几个关键词,参数、算力和模型架构大概最容易被提到。但到了 2026 年,另一个更基础的问题正在被重新摆到台前:模型究竟拿什么继续学习?
在贵州举行的 2026 数博会上,热点科技参加了本原智数首届生态发布会,并来到其展位体验。相比单纯强调 " 数据标注 ",本原智数这次把讨论范围拉到了 AI 全生命周期:从评测发现能力短板,到专家生产高质量数据,再到智能体持续运行,以及面向具身智能的物理数据建设。
这背后值得关注的,不只是数据服务商增加了几个平台,而是 AI 数据产业本身正在换挡——从 " 有多少数据 " 转向 " 什么数据真正有用 ",从一次性交付转向围绕模型能力持续迭代。
数据公司的角色,正在从 " 施工队 " 变成标准共建者

本原智数创始人李逆勇在第一届本原智数生态发布会上分享
发布会上,本原智数创始人李逆勇把行业变化概括得很直接:过去客户给出原始数据和标注文档,数据公司负责采集、清洗、标注、审核,更像按照图纸施工;但随着大模型、智能体、世界模型和具身智能继续发展,客户真正关心的问题已经变成 " 什么样的数据能够让模型能力继续提升 "。
按照本原智数披露的数据,公司累计交付 500 多个大型项目,年均标注量达到数亿级,核心项目交付及时率为 100%,质量达标率超过 98%。但比这些交付指标更值得注意的是,它正在把评测、标准和数据生产放到同一套体系里:先判断模型缺什么,再反向决定该生产什么数据。相关数字均为企业现场披露口径。

发布会现场公布本原智数 AI 全生命周期基础设施:原测、原识、原智与原物
现场展示的四个平台分别对应不同环节:原测 OriginBench 负责 AI 全生命周期评测;原识 OriginWise 面向专家级数据生产;原智 OriginFlow 聚焦智能体运行与持续进化;原物 OriginPhysics 则把能力延伸到具身智能的数据采集、训练和评测。
这套思路的关键不是 " 工具更多了 ",而是把评测和数据生产连接起来。过去数据往往在模型训练之前完成,交付后项目就结束;现在则更像一个循环:模型运行产生经验,评测暴露问题,再生成或组织新的高质量数据,继续进入下一轮训练和优化。
真正稀缺的,正在从通识语料变成专家经验
为什么高质量数据越来越重要?一个现实变化是,互联网上容易获取的公开文本并不会无限增长,而模型能力又开始进入医疗、金融、法律、代码、科研等专业领域。此时简单增加通用文本,很难等比例换来能力提升。
本原智数给出的方向是 " 专家数据 "。例如医疗数据由专业医师参与,金融数据覆盖银行、保险、证券等场景,法律数据需要专业人员对合同风险进行判断,Coding 数据则进一步覆盖 GPU 内核、软件工程和 Agent 工具调用。企业资料显示,其专家数据生产已覆盖金融、医疗、法律、科学、教育、工业等十余个垂直领域。

本原智数提出 Digital AI 飞轮,将运行、经验、评价、生产和进化连接成持续循环
这里真正发生的变化,是 " 标注 " 这个词已经不足以概括数据生产。AI 需要学习的越来越不是一个标签,而是人类解决问题时的判断依据、执行路径、失败经验和反馈过程。尤其进入 Agent 阶段之后,一条完整的任务轨迹——调用了什么工具、为什么做出选择、执行结果如何——本身就可能成为新的训练资产。
从这个角度看,未来数据服务行业的门槛未必只取决于拥有多少标注人员,而会越来越取决于能否组织专家、定义标准、形成评测体系,并把这些知识规模化转化成机器可以学习的数据。
AI 从数字世界走向物理世界,数据形态也在变
这种变化在具身智能上更加明显。文字和图片可以从互联网获得,但机器人如何抓取、移动、操作工具,以及失败后怎样调整,并不存在一个天然可下载的 " 互联网数据库 "。数据必须在真实或仿真环境中被重新生产出来。

第一届本原智数生态发布会现场,以 " 数据为本 原力智慧 " 为主题
因此,本原智数在发布会上提出未来五年的 " 双十亿计划 ":建设十亿条专家轨迹数据,面向数字信息交互任务;同时建设十亿小时具身操作数据,面向物理场景交互任务。按照企业的解释,前者希望沉淀人类处理复杂数字任务的知识和决策过程,后者则让 AI 学习真实世界中的感知、行动与反馈。
目标最终能达到什么规模仍需要时间验证,但方向本身很有代表性:AI 数据产业正在从网页文本和图片,进入任务轨迹、3D/4D、传感器、机器人操作等更难获取的数据类型。数据的生产成本更高,但与下一阶段 AI 能力的关系也更加直接。
热点洞察:AI 基础设施的竞争,正在补上 " 数据闭环 " 这一层

发布会展示七大核心数据能力体系,覆盖多模态、Physical AI、行业知识、Agent、Coding、智力数据与 Research
过去谈 AI 基础设施,行业更习惯把重点放在 GPU、服务器、云平台和模型框架上。但随着模型逐渐进入产业场景,仅有算力和模型并不能自动解决效果问题。企业会越来越频繁地面对三个问题:能力怎么测、问题出在哪里、下一批数据应该怎么补。
这也是本原智数此次发布内容最值得观察的地方。它试图把 " 评测—数据生产—运行—再评测 " 做成持续循环。对于数据服务商来说,这意味着商业模式可能从项目制的人力交付,逐渐转向平台、标准、专家网络和长期数据运营;对于模型厂商和企业客户来说,数据也不再只是训练开始前准备的一批原料,而会成为伴随 AI 系统整个生命周期持续更新的基础设施。
今年 6 月,千百度宣布收购本原智数控股权,并向 AI 数据业务投入更多资源。公开信息显示,本原智数业务已经覆盖大模型、世界模型和具身智能,并形成 OriginBench、OriginWise、OriginFlow、OriginPhysics 四大平台。资本进入只是一个侧面,更重要的是,它反映出高质量 AI 数据正在从幕后环节走向产业链更核心的位置。
贵阳想留下的,也不只是 " 数据标注订单 "
发布会最后一个值得关注的信号,是本原智数把生态计划的核心放在贵阳。企业提出未来五年面向全球招募 100 个千人级核心数据生态伙伴,并希望推动生态伙伴年总产值达到 100 亿元;原测 OriginBench 和原识 OriginWise 等平台能力也计划进一步向伙伴开放。上述目标属于企业规划,并非当前已实现规模。
对贵州来说,这也对应着数据产业发展的下一道题。早期数据标注产业更多依赖人力和成本优势,但 AI 进入专家数据、智能体和具身智能阶段后,竞争要素已经扩展到专业人才、评测标准、数据工程平台以及与模型厂商的协同能力。一个地区如果只承接标注订单,很容易停留在产业链较低附加值环节;如果能够进一步形成标准、工具、专家和数据资产,则有机会把一次性项目变成持续的数据产业生态。
从本届数博会现场来看," 数据为本 " 并不是一句回到旧话题的口号。恰恰相反,当模型越来越强、算力越来越充足之后,什么样的数据能够让 AI 继续进化,反而变成了一个更难、也更有价值的问题。
模型的参数会更新,技术路线也会变化,但 AI 始终需要从真实世界和人类经验中学习。下一阶段 AI 基础设施的竞争,或许不仅是 " 谁能算得更多 ",还会变成 " 谁能持续生产、评测和组织更有价值的数据 "。这也是本原智数此次发布会留给我们的最大观察。


登录后才可以发布评论哦
打开小程序可以发布评论哦