
LG AI Research 周五宣布,其旗下两款工业 AI 模型 EXAONE Tabular 和 EXAONE Forecast,在聚焦工厂车间、交易大厅及医院病房等真实场景的基准测试中夺得全球第一。与常见的 LLM 推理测试不同,此次竞争聚焦于企业 AI 核心的表格数据和时间序列处理能力。
在结构化数据基准 TabArena 上,EXAONE Tabular 取得 1,760 分的 ELO 得分,超越谷歌 TabFM 模型的 1,749 分。在 Salesforce 开发的时间序列预测基准 GIFT-Eval 零样本类别中,EXAONE Forecast 同样排名第一,击败谷歌和阿里巴巴的模型。这两个基准均由公众托管、独立运营,采用能源、金融、医疗等领域的真实工业数据集,而非假设性测试。
工业基准为何比 LLM 排行榜更具实战意义
尽管 GPT 风格的推理基准催生了具备强大能力的 AI 系统,但大型工业企业真正需要的并非散文生成或冷知识问答,而是对供应链结构化表格、需求预测时间序列以及传感器数据的统计精度分析。
表格数据是企业环境中的主导数据类型。过去 15 年,梯度提升树模型(如 XGBoost、LightGBM)凭借对异构工业表统计关系的处理能力,长期占据主导地位。然而,随着表格基础模型(TFM)的兴起,这一格局正在改变。TFM 以原生格式处理表格,通过上下文学习(ICL)机制,能在无需重新训练的情况下泛化至新表格,尤其在小数据集场景下表现优于传统方法。
EXAONE Tabular:小数据场景下的性能突破
EXAONE Tabular 作为表格基础模型,避免了传统 LLM 将表格序列化文本导致结构信息丢失的问题。它通过学习海量合成数据掌握表格通用先验知识,并在推理时结合训练集和测试行进行贝叶斯推断。
在 TabArena 的小数据集子集中,基础模型排名靠前,而梯度提升树落后数百个 ELO 点。TabArena 由 AWS 和弗赖堡大学团队推出,是首个持续维护的 " 活体 " 基准系统。谷歌于 2026 年 6 月 30 日提交 TabFM 模型后占据榜首,随后 LG 将 ELO 得分提高 11 分,以 1,760 分确立分类数据预测的总体领先地位。
该模型仅需极少输入数据即可执行二元或多类分类任务,适用于电池电芯质量预测、疾病风险评估、贷款违约检测等场景。LG AI Research 计划于 2026 年下半年在制造、生物医疗保健和金融领域开展概念验证试验。
EXAONE Forecast:零样本时间序列预测能力
EXAONE Forecast 在 GIFT-Eval 基准中的胜利更为显著。该基准涵盖 23 个数据集、超过 1.77 亿个数据点,重点评估模型在未微调情况下的零样本预测能力。EXAONE Forecast 凭借在异常庞大且异质的合成数据集及 LG 专有时间序列数据上的训练,实现了对不熟悉数据集的准确预测,领先于谷歌和阿里巴巴的模型。
目前,EXAONE Forecast 已部署于 LG 旗下子公司:用于 LG 电子的季节性产品需求预测、LG 新能源的原材料(如锂)价格预测,以及通过与 Koscom 和伦敦证券交易所集团(LSEG)合作开发的金融 AI 服务,为约 8,000 只股票提供每日预测分数。该金融服务已于 2025 年 9 月推出。
专有数据构建结构性护城河
LG 的双基准胜利揭示了工业 AI 与通用 LLM 的竞争差异:前者更依赖对特定、历史深厚且专有运营数据的访问权限,而非单纯的计算规模。谷歌 TabFM 选择合成数据训练,部分原因在于无法获取真实的专有工业数据。相比之下,LG 在制造、能源、医疗和金融领域积累了半个世纪的专有数据,构成了难以复制的结构性护城河。
LG AI Research 联席主管 Lim Woo-hyung 表示,全球科技公司的重点正从通用语言模型转向行业特定 AI,韩国企业集团的数据优势将成为差异化竞争关键。
局限性与未来展望
尽管基准测试独立可审计,但 LG 发布的概念验证用例尚未经过生产性能的独立验证。对于拥有大型、标注良好数据集的企业,梯度提升树仍具竞争力,TFM 的优势主要集中在小数据场景。
随着 EXAONE 生态系统的扩展,包括通用语言、多模态视觉、计算病理学及机器人基础模型在内的领域特定模型,正逐步构建起 LG 的工业 AI 基础设施层。这一转变表明,随着通用 LLM 边际性能差异缩小,专有数据驱动的工业垂直领域将成为全球 AI 竞争的新高地。
【星途科讯 图文丨略略 首发于 ZAKER 科技,转载请注明出处】


登录后才可以发布评论哦
打开小程序可以发布评论哦