【CNMO 科技消息】8 月 11 日消息,韩国 SKT 自主研发的 AI 模型 A.X K2 在国际数学奥林匹克竞赛(IMO)评测中取得 29 分的成绩,与 2026 年 IMO 金牌分数线持平,成为除美国和中国之外地区开发的 AI 模型中唯一达到该标准的选手。与此同时,该模型在全球数学推理基准测试中也创下并列最高分纪录,其数学推理能力获得多方验证。

图源网络
据 SKT 新闻室公布的信息,A.X K2 在 IMO 2026 的六道题目评测中获得 29 分,满分 42 分。这一分数恰好与今年 IMO 金牌分数线相同。值得注意的是,中国小红书旗下的 dots-note-3.0 在该评测中取得满分 42 分,A.X K2 则是紧随其后、唯一达到金牌标准的韩国本土 AI 模型。
在 IMO 2025 往届试题评测中,A.X K2 同样表现出色,取得 35 分的成绩,超过了当时的金牌分数线。在韩国数学奥林匹克(KMO)2026 第二轮评测中,该模型更是斩获满分。此前,其前代模型 A.X K1 在 KMO 第一轮考试中也曾获得韩国自研模型中的最高分。
在开源 AI 平台 Hugging Face 的 MathArena AIME 2026 排行榜上,A.X K2 以 97.1% 的准确率登顶。AIME 是美国数学奥林匹克的选拔考试,MathArena AIME 2026 基于今年 AIME 试题公开了 30 道题目,用于评估 AI 模型的最终答案准确率。在这一高难度数学推理评测中,A.X K2 与 OpenAI 前首席技术官米拉 · 穆拉蒂创立的 Thinking Machines Lab 旗下的 Inkling 模型并列最高分。中国阶跃星辰的 Step-3.5-Flash 取得 96.67%,月之暗面的 Kimi-K2.6 获得 96.4%。

图源网络
数学能力之所以被视为 AI 模型的核心性能指标,原因在于它能够检验模型将复杂问题拆解为多个步骤、进行逻辑推理并得出一致结论的能力,而非单纯的计算速度。数学问题的另一优势在于答案对错分明,便于客观验证模型的推理能力,这与自然语言评测中难以区分 " 看似合理 " 和 " 真正正确 " 答案的情况形成对比。
正因如此,高水平的数学推理能力不仅是金融、会计等领域的重要应用基础,也成为衡量 AI 在制造工艺优化、物流调度、科学研究等需要复杂计算和多阶段判断的产业领域应用潜力的关键指标。计算或推理过程中的微小误差可能导致成本上升或决策失误,因此 AI 模型的精确推理能力至关重要。


登录后才可以发布评论哦
打开小程序可以发布评论哦