科技资讯网 08-25
谁的数据,先成为AI的“原住民”?——从2026科学智能大会,看科技数据的下一个十年
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者:白鹏飞

一个判断,值得所有做产业的人想三秒。

8 月 21 日,2026 科学智能大会在北京举行,近 50 位院士和来自政府、高校、科研院所、企业等机构的 4000 余人参加。之江实验室主任王坚在科学数据平行会议上提出:人工智能的发展经历了数据、模型、算力等要素接续推动的过程,下一阶段将进入新的 " 数据周期 " ——未来 3 至 5 年,甚至 10 年,推动 AI 变革的关键是科学数据。

更重要的是,今天讲 "AI+ 科学 ",不能只理解为 " 用 AI 帮助科研 "。科学问题的挑战、科学数据的独特性,也可能反过来推动 AI 自身发生质变。

就在这场会议上," 让科学数据成为基础模型的原住民 " 成为圆桌主题。

" 原住民 " 其实是一个更大的议题:如果科学数据要 " 住进 "AI,那么金融、制造、医疗、能源 …… 这些行业最核心的专业数据,什么时候也能真正 " 住进 "AI?

这可能是未来十年,比 " 谁的模型更大 " 更值得关注的竞争。

一、为什么 AI 还读不懂真正重要的原始数据?

今天的大语言模型擅长处理文本、代码等已经被人类整理过的信息。但科学世界并不是一个 " 文本世界 "。

一条光谱、一组地震波、一段基因序列,真正有价值的信息,往往不在文字说明里,而在原始数据的结构、变化和关系中。

在地学领域,超过 70% 的地球科学信息并不存在于文字论文中,而是沉淀在光谱、地震波、声波等原始观测数据里。

这意味着," 先把数据变成文字,再让 AI 理解 " 的路径,可能从一开始就丢失了最有价值的信息。

大会讨论的科学数据 Token 化,本质上就是在解决这个问题:不是把数据 " 翻译 " 成人类语言再给AI,而是让AI学会理解数据自己的语言。

二、重大科学发现,总发生在 " 数据重新相遇 " 的地方

这次会议上,有一个关键词印象深刻:相遇。

之江实验室专家分享了一个很有张力的案例:米兰科维奇旋回的证实,是天文数据与地学数据在时间轴上的 " 相遇 " ——早期的天体力学计算,后来被海底沉积岩中的周期性数据进一步验证。

过去,这种相遇依赖科学家的知识边界、跨学科交流和偶然机遇。

今天,AI 提供了一种新的可能:把过去依赖人脑完成的数据连接,变成可以规模化、持续化的机器能力。

之江实验室的 021 科学基础模型,正通过统一编码、统一表征和关联推理,探索把跨学科连接沉淀为模型能力。

真正值得期待的,也许不是 "AI 能回答更多问题 ",而是:AI开始有机会发现过去没人注意到的数据关系。

三、Token 化:让不同数据拥有 " 机器可理解的表达 "

天文图像、气象数据、数学公式,本来就不是同一种东西,怎样让它们进入同一个模型体系?

这正是 Token 化的难点。

上海科学智能研究院分享的 " 伏羲 " 气象模型,探索让多类科学数据原生接入模型,通过跨模态联合建模进行语义对齐;新加坡国立大学张磊则提出,数学今天已经 " 数字化 ",却还没有真正 " 数据化 ",需要让数学内容像代码一样可编译、可验证。

之江实验室史大治进一步指出,下一代基础模型的重要增量,不只是更多文本,而是大量尚未被模型处理和充分理解的原始科学数据;围绕这一目标,之江实验室正在建设海纳数据枢纽,探索多类科学数据 Token 化的方法。

Token 化真正要解决的,是让原本彼此不同、彼此隔离的专业数据,获得机器可以理解、比较、关联和推理的表达方式。

四、每个行业,都有自己的 " 原始数据巴别塔 "

把视野从科学领域拉出来,会发现一个更有意思的现象:每个行业,都有自己的 " 原始数据巴别塔 "。

金融有高频行情,制造有设备传感流,医疗有医学影像和组学,能源有运行曲线和地质数据。

知识产权领域,则有专利全文、权利要求、附图、引用网络、法律状态与长期技术演化记录。

专利不是一篇普通的技术文章。

一份专利同时承载技术问题、技术方案、权利要求、附图和结构式等多模态信息,也包含申请、公开、授权、无效等法律状态,以及引用关系和长期的技术演化信息。

从数据形态看,专利更像一种多模态、关系化、带时间演化属性的技术知识数据。

全球 90% 以上的技术情报首先通过专利公开。如果把这个判断放到 AI 时代重新看,专利就不只是 " 数据库里的资料 ",而是一层持续记录技术创新、演化与积累的结构化数据。

那么问题也随之发生变化:AI什么时候才能真正 " 读懂 " 专利?

五、为什么知识产权数据,值得成为 " 原住民 " 样本?

这也是在现场听到 " 让科学数据成为基础模型的原住民 " 后,特别想到八月瓜科技的原因。

过去,知识产权数据更像一种信息资源;今天,它正逐渐变成一种技术基础设施。

八月瓜科技长期深耕知识产权数据与 AI 服务,已形成覆盖全球 178 个专利受理局、超过 2 亿条专利数据的数据底座,并持续向智能化数据服务延伸。

但真正值得关注的,不只是数据规模。

专业数据要成为AI的 " 原住民 ",真正的门槛是把复杂的数据变成机器能够理解、关联和调用的知识。

对专利而言,从清洗、去重、分类和语义标引,到图文关联、关系组织和技术知识表达,这件事的本质,不是简单地 " 做一个更大的数据库 ",而是让原本供人阅读、搜索和分析的数据,逐步变成 AI 可以理解、调用和推理的技术知识基础设施。

从 " 检索专利 ",到 " 理解技术 ",再到 " 辅助创新决策 ",知识产权数据正在经历一次角色变化。

六、竞争正在从 " 模型 ",转向 " 专业数据原住民 "

这次大会释放出的信号,正在从科研议题走向产业基础设施议题。

大会围绕科学数据底座、数据采集、清洗、标注、质量评价和科研流程智能化展开讨论;北京市相关科学智能政策,也把标准化科学数据底座作为重要方向。

这意味着," 数据底座 " 已经不只是科研机构内部的数据建设问题,而正在成为科学智能乃至 AI 产业竞争的基础设施问题。未来 AI 真正难复制的,也许不是某个模型,而是四件事能否同时成立:

高质量数据;

机器可理解的数据表达;

真实业务场景;

持续产生新数据的闭环。

一旦这些能力形成闭环,模型就不再只是 " 问答工具 ",而开始成为一个行业的基础设施。

在科技创新领域,也可能需要经历同样的一次跃迁:让论文成为数据,让专利成为数据,让技术关系成为数据,让产业知识成为AI真正可以调用的知识。

谁能更早让自己的核心数据被AI真正理解,谁就可能更早获得下一轮创新的入口。而知识产权数据,也许正是这场 " 专业数据原住民化 " 中,一个值得长期观察的样本。

数据的相遇,往往就是下一个发现的开始。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 张力 王坚 米兰 医疗
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论