文汇 昨天
上海AI公司发布专用决策模型,登顶决策榜,38项基准中31项高于Jev
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

近日,专注本地智能解决方案的上海人工智能企业 StartLux(原点星辉)发布专用决策模型 StartLux-Decision,并开放代码与模型权重。在 StartLux 公布的测评数据显示,在独立的 DecisionIndex 0.2.1 评测中,StartLux-Decision-27B 得分 63.88,高于 Jev 1.13 的 57.91;在 38 项基准中,有 31 项得分更高。

另一组参照,来自上海人工智能实验室发布 Intern-Decision 时采用的七项评测组合。在该组合中,StartLux-Decision 的 27B 版本平均准确率为 91.82%,高于 Jev 的 88.74% 和 Intern-Decision-4B 的 90.02%。

性能方面,在单张 H200、BF16 精度和短请求条件下,4B 版本一次回答三个问题平均耗时 26 毫秒,0.8B 与 2B 版本分别为 12.2 毫秒和 15.5 毫秒。测试通过本地 HTTP 进行,并启用快速计算内核与 CUDA Graphs,测量的是请求响应时间。

据团队介绍,决策模型瞄准的是智能体执行任务时大量重复出现的判断:下一步点哪个按钮、调用哪个工具、当前任务是否完成。这些问题的候选项往往已经明确,但每一步等待仍会累积,影响整体执行效率。

StartLux-Decision 接收当前状态和候选项,支持选择题、是非题与等级评分。对于常规请求,它可以通过一次前向计算返回多个问题的判断及选项概率,无需逐字生成回答文本。

例如,同一条客服工单可以同时对应三个问题:应交给哪个团队、是否需要当天处理、影响程度如何。执行程序拿到结构化结果后,可以继续分流或操作;需要撰写回复、展开复杂规划时,则由通用模型接手。

完成 StartLux-Decision 的研发与验证全程仅用 3 天。让这套模型跑起来的,是 StartLux 正在建设的 RSI(递归式自我改进)体系中的 Auto Research 环节。据团队介绍,它让 AI 参与 " 假设—实验—验证—新假设 " 的循环:分析上一轮失败、构造数据、执行训练与评测,再提出下一轮值得尝试的改进。在这一循环中,研究目标、评价标准和关键取舍仍由人类研究员把关。AI 承担更多实验执行和分析工作,研究员则依据实际结果判断改动是否有效。

在此基础上,StartLux 希望进一步提升 AI 提出假设、设计实验和验证改进的能力,使 " 改进 AI" 的能力本身也持续提高。此次 StartLux-Decision 的研发,是这套体系中 Auto Research 环节的又一次具体实践。

目前,StartLux 已公开该决策模型的权重、相关代码和评测结果。Auto Research 则仍作为公司内部的研发环节运行,此次对外发布的是这一流程产出的模型成果。

现有测试主要反映模型在公开基准和受控环境中的表现。它在更复杂任务中能否持续作出可靠判断,以及自动研究方法能否在更多项目中稳定带来效率提升,仍需通过后续实验和实际应用检验。

按照 StartLux 的技术路线,决策模型将与通用模型、智能体及运行时等模块协同,服务完整的本地智能解决方案。此次发布既为开发者提供了可使用的决策组件,也展示了 AI 参与模型研发的实践。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 人工智能 上海
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论