钛媒体 昨天
大模型领域跑出新玩家,StartLux-27B本地大模型打赢DeepSeek V4 Flash
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

图片来源:unsplash

近日,中国工信部信息通信研究院(以下简称 " 中国信通院 ")人工智能研究所公布的一份检验报告显示,上海原点星辉科学技术有限公司(下简称 StartLux)研发的本地大模型 StartLux-V1.0-27B-Preview,在可信 AI 大模型基准测试—— MCP 专项测试中,以 27B 参数量取得综合性能排名第二的成绩,高于第三名的 DeepSeek-V4-Flash,能力范围已经进入 DeepSeek-V4-Pro 所代表的万亿参数模型能力区间。   

可信 AI 大模型基准测试—— MCP 专项测试涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D 设计 6 类专项任务及综合评估,共 7 项检验项目,重点考察大模型在多工具协同、复杂任务执行及真实环境交互等方面的综合表现,该专项测试部分指标和数据参考了开源项目 MCP-Universe。参测模型包括 DeepSeek-V4-Pro(1.6T)、DeepSeek-V4-Flash-0731(284B)、Step-3.7-Flash(198B)、StartLux-27B-260715(27B)、Qwen-3.6-27B(27B)和 AgentCPM-Explore(4B)。

结果显示,StartLux-V1.0-27B-Preview 综合得分为 39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731 和 198B 的 Step-3.7-Flash。在同等参数规模下,StartLux-V1.0-27B-Preview 较 Qwen-3.6-27B 高出 5.34 个百分点。单项任务中更突出:位置导航排名第一,浏览器自动化、金融分析等任务也与 1.6T 参数的 DeepSeek-V4-Pro 并列第一或独占第一。

StartLux 以 Qwen3.6-27B 为基座做后训练定向增强,把一个 27B 的本地模型,推到与 1.6T 旗舰同级的位置,靠的是 StartLux 团队自主设计的一个全新、多维度、可验证、可规模化的模型优化升级技术。模型训练的过程中,团队采用 AI 训练 AI(Auto Research)的方法,自主开展训练实验,并通过反馈持续优化训练策略。该方法代表了当前全球模型研发的前沿方向。据悉,StartLux-V1.0-27B-Preview 是国内首个采用该方法进行后训练的本地 Agent 模型。

在这款模型背后,可以看到行业正在发生的一个清晰转向:当基础模型能力跨过实用门槛,过去两年以参数规模为核心的军备竞赛已进入同质化阶段。同等规模模型在 Benchmark 上的差距越缩越小,但用户和企业的真实困扰从来不是大模型的测试分数与排名,而是模型能否解决实际问题、数据是否安全、成本是否可控。这些答案不在越来越大的云端集群里,而在数据不出域、推理在身边、能力可定制的本地方案里。

在全球范围内,本地模型正在逐渐进入行业视野。Google 于 4 月推出了 Gemma 4 系列,其中 31B Dense 版本在开源模型排行榜排名第三,量化后可在消费级显卡上本地运行。8 月初,Meta 发布 30B 本地模型 Muse Glimmer 并开源。英伟达也于 8 月推出了开源模型 Nemotron 3.5 Lightning,这是一款 30B 参数的 MoE 模型,可直接在 RTX PC 等本地设备上运行。盛大网络创始人、语生科学董事长陈大年近期预测,本地本地模型将在 3 年内占据 80% 的大模型市场。量子与 AI 软件公司 Multiverse Computing 联合创始人兼首席科学官 Roman Or ú s 也曾表示,行业正进入一个新阶段,本地大语言模型将成为云端服务真正的竞争对手。

目前,StartLux-V1.0-27B-Preview 可在消费级个人电脑上运行。据了解,StartLux 计划于年内推出第一代本地智能解决方案,与此同时,StartLux 团队正在稳步推进模型训练的脚步,也正对扩散式语言模型等新架构进行深入研究和优化。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 自动化 上海 中国信通院 工信部
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论