2026 年 8 月,中国信息通信研究院(以下简称 " 中国信通院 ")公布第三批 " 词元(Token)服务能力攀登计划 " 攀登结果。星环科技通过企业级 Token 服务性能攀登基线(通用场景)测试。
本次参测模型服务基于星环科技人工智能模型运营平台 Sophon LLMOps 的 Token Factory 模型服务层构建,所有请求经由 Token Factory 网关统一接入、智能路由与精确计量。
测试基线要求包括:每秒输出 Token 数(TPS)≥ 55 个 / 秒、首 Token 时延(TTFT)≤ 0.9 秒、调用成功率≥ 99.9%。通过此次测试,参测服务在通用场景下的输出速度、响应时延与调用稳定性得到验证。
从模型上线到稳定服务,企业还需要什么
模型部署完成,只是企业应用大模型的开始。随着业务接入增多,新的问题逐渐显现:高峰期响应变慢,多个模型难以统一管理,调用量持续增长却说不清成本去向,安全策略也分散在各个应用中。
Token 是大模型处理和生成内容的基本单位。对企业而言,Token 服务能力直接影响应用体验与运营成本:输出速度关系到内容生成效率,首 Token 时延影响用户等待体验,调用成功率则反映服务的可靠程度。
围绕这些需求,Token Factory 将推理、路由、运营与安全能力整合到统一的模型服务层,覆盖从算力管理到模型调用的各个环节,支撑企业持续运营大模型服务。
用好算力,让模型服务跟上业务负载
企业采购 GPU、完成模型部署后,仍可能面临高峰期资源不足、低谷期算力闲置的问题。采用不同芯片时,适配与管理也会增加运维负担。
Token Factory 是星环科技人工智能模型运营平台 Sophon LLMOps 的核心模型服务层,支持多类型异构推理算力统一纳管,将不同型号的算力资源纳入统一资源池,集中调度与监控,并提供国产芯片适配支持。
在此基础上,平台集成多种推理优化技术,提升算力利用效率,改善并发处理与响应表现;同时根据负载自动扩缩容,在业务高峰时增加服务资源,在低谷时回收空闲资源,减少长期按峰值配置造成的浪费。
统一模型入口,按需分配每一次调用
企业同时使用自建模型与外部模型 API 时,各团队分别对接供应商,容易形成分散的调用入口,也增加了模型切换和故障处理的复杂度。
Token Factory 统一接入内部推理服务与外部 API ,为开发团队提供一致的调用入口,减少重复对接工作。平台可根据任务场景、时延要求与成本预算选择模型,让不同任务匹配适当的服务资源。
例如,摘要提取等任务可优先使用成本较低且满足效果要求的模型,复杂分析任务则选择能力更强的模型。当某个模型服务限流或发生故障时,平台可通过备用模型兜底与自动切换,降低单一服务异常对业务的影响。
算清 Token 账,把成本管理落实到每次调用
模型调用规模扩大后,企业需要知道:哪个部门在用、哪些应用消耗最多、费用为什么增长,以及预算是否足以支撑后续业务。
Token Factory 将每次调用的 Token 消耗记录下来,并按业务线、模型、部门和项目归集成本。当账单出现异常变化时,管理者可以进一步定位消耗来源,为优化模型选型、调用方式和资源配置提供依据。
平台支持为不同团队和应用设置预算与配额,通过阈值预警和超额控制,将成本管理前移到使用过程中。同时,基于历史用量进行容量预测,辅助企业规划算力资源与采购预算。
这些能力将模型调用数据转化为可追踪、可分析的成本信息,为企业建立 AI FinOps 成本治理体系提供支撑。
将安全管理贯穿模型调用过程
模型服务面向更多团队和应用开放后,访问权限、敏感信息保护与审计追溯需要统一管理。
Token Factory 为调用方提供独立凭证,按权限控制模型访问与使用额度;对输入输出内容进行安全检测,支持敏感信息过滤与违规内容拦截,减少各应用重复建设安全能力的工作。
平台同时记录调用来源、调用内容与处理结果,为事件回溯和审计提供依据,让模型服务纳入企业整体安全治理体系。
让 Token 服务支撑 AI 应用持续落地
从试点应用走向规模化使用,企业对大模型的关注逐步延伸到服务效率、稳定性、成本与安全。模型能否持续支撑业务,需要这些能力共同保障。
此次通过中国信通院 Token 服务性能攀登基线测试,是星环科技模型服务能力的一次验证。星环科技将持续完善 Token Factory 的推理优化、模型调度和运营管理能力,帮助企业用好算力、管清成本,为 AI 应用持续落地提供支撑。


登录后才可以发布评论哦
打开小程序可以发布评论哦