
AI 领域正热议一种新型架构:非自回归、不生成文本,能对结构化模式提供极速概率预测。针对这一趋势,开发者发布了完全开源的横向 System 1 决策模型家族——Laya。
早在 2025 年 3 月,相关研究者便已着手此类架构探索,通过强化学习构建非自回归决策框架,并公开了论文、模型权重及数据集。2026 年 9 月,由 OpenAI ChatGPT 共同发明人 Diogo Almeida 创立的 TypeSafe AI 推出了 Jev。尽管 Jev 提出的非自回归决策概念引发关注,但其采用封闭专有模式,未开源技术细节。相比之下,Laya 旨在修复旧有架构局限,提供完全开放的替代方案。
核心洞察:用 System 1 思维重塑决策
现代 AI 流水线常误用生成式大语言模型(LLM)处理简单反射性决策,如工单路由、垃圾邮件识别或提示词安全检测。调用 8B 至 70B 参数的生成式 LLM 不仅耗时(500-2000 毫秒)、成本高,且易产生幻觉,其输出的置信度往往缺乏数学校准依据。
Laya 模拟人类大脑的 System 1 机制,在商用硬件上仅需32.8 毫秒即可做出即时决策,并提供诚实、校准的概率。它通过单次前向传播评估状态,依赖三种原语:
choice(选择):从标准字典中选择选项,返回概率分布及校准置信度。
score(评分):将状态映射至序数量表,返回期望级别及排名分布。
noul:针对布尔值问题,输出 0.0 至 1.0 之间校准的概率。
由于输出空间仅限概率和数字,模型从根本上杜绝了文本生成幻觉及格式错误。
多检查点与智能路由架构
为解决单一模型在多语言和任务上的局限,Laya 发布了三个专用检查点,并整合至 Hugging Face 单一仓库中:
| 检查点 | 主干编码器 | 参数量 | 主要优势 |
|---|---|---|---|
| laya | ModernBERT-large | 421M | 英语文本分类、护栏、邮件分拣 |
| laya-multilingual | mmBERT-base | 322M | 支持 100+ 种语言,速度快 2.2 倍 |
| laya-typed-decisions | ModernBERT-large | 421M | 智能体可观测性、客户服务、安全警报 |
借助 Hugging Face 的 allow_patterns 功能,Laya SDK 支持选择性下载特定子文件夹,避免下载全部 2.5GB 权重。
研究显示,英语模型在处理非拉丁脚本(如高棉语、印地语)时,即便准确率极低,置信度仍可能虚高。为此,Laya 内置亚毫秒级纯 Python 路由器,通过 Unicode 脚本检测和停用词分析,自动匹配最佳模型。路由开销仅为 0.09 至 0.73 毫秒,占总延迟不到 2%,且支持预加载以消除冷启动惩罚。
Laya vs TypeSafe Jev:性能全面领先
基准测试显示,Laya 在多项指标上优于 TypeSafe Jev 1.13.0:
| 指标 | TypeSafe Jev | Laya ( 已路由 ) | 优势 |
|---|---|---|---|
| typed-decisions 准确率 | 0.727 | 0.766 | 提升 3.9% |
| 校准误差 ( ECE ) | 0.246 | 0.081 | 校准效果好 3 倍 |
| P50 延迟 ( 单问 ) | 236 – 276 ms | 32.8 ms | 速度快 7.8 倍 |
| P50 延迟 ( 10 问批处理 ) | ~1,500 ms | 72.3 ms | 速度快 20 倍 |
| 成本 | $0.042/ 百万 token | $0.00 ( 自托管 ) | 100% 免费 |
| 开源状态 | 封闭专有 | Apache 2.0 开源 | 支持本地部署 |
在真实工作流中,Laya 在电子邮件垃圾过滤(准确率 0.993)、网络钓鱼检测(准确率 0.980)及 LLM 护栏(准确率 0.755 – 0.762)等场景均表现出生产就绪的质量。
局限性与适用边界
Laya 并非全能,存在以下限制:
选项数量限制:当分类选项超过 20 个时,性能显著下降。在 Banking77(77 个标签)测试中,Laya 得分为 0.425,低于 Jev 的 0.870。建议将选择模式保持在 20 个选项以内,或采用层级结构。
需微调适配:基础模型在特定基准测试中得分接近随机水平,0.766 的高分源于对训练集的微调。用户需针对自身领域数据进行专业化微调。
温度校准:需针对特定领域分布拟合标量温度,以将校准误差从 0.466 降至 0.081。
快速入门
Laya 已通过 PyPI 发布,支持 pip 安装。开发者可通过内置 Router 实现自动语言路由和多问题并行评估,单次前向传播即可同时获取队列分配、紧急程度评分及流失风险概率。
从 2025 年初的探索到如今的成熟发布,Laya 证明了一个核心观点:并非所有 AI 问题都需要自回归聊天机器人。对于大规模分类、路由和安全检测, sub-35 毫秒的双向决策模型提供了更快、更诚实且完全开源的解决方案。
【星途科讯 图文丨周鑫雨 首发于 ZAKER 科技,转载请注明出处】


