科技资讯网 7小时前
从训练数据里揪出一个隐藏空格——IQuest-Q1的“实战能力”藏不住了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

9 月 29 日,至知创新研究院(IQuest Research)发布并开源 IQuest-Q1。模型重点面向代码、软件工程与复杂任务执行,在训练过程中进一步覆盖推理、工具使用、长上下文理解及多步任务处理等能力。

模型权重与 Blog 已同步发布。

GitHub:https://github.com/IQuestLab/IQuest-Q1

Hugging Face:https://huggingface.co/IQuestLab/IQuest-Q1

Blog:https://iquestlab.github.io/

多场景任务中的能力验证

IQuest-Q1 的训练重点覆盖从代码生成到智能体任务,并延伸至工具调用、信息搜索、长上下文理解和复杂环境中的多步执行。模型可在任务过程中持续理解上下文、调用工具、处理反馈,并完成可验证的最终结果。

在涵盖代码、软件工程、终端操作、工具使用和复杂智能体任务等多个领域的标准评测中,IQuest-Q1 均展现出均衡稳健的性能。

其中,IQuest-Q1 在仓库级代码生成基准 NL2Repo 和网络安全基准 CyberGym 上展现出一定能力;同时,在 Terminal-Bench 2.1、代码长程任务基准 DeepSWE v1.1,以及面向专业办公场景的 JobBench 等复杂任务评测中,也表现出较好的任务执行能力。

具体到实际任务,可以一起看下在几个典型场景中的实测。

· 复杂交互应用开发

在前端开发中,用户输入自然语言指令后,模型可以直接生成可运行的交互应用。

以 FPS 游戏为例,IQuest-Q1 可以一次完成三维场景、角色移动、生命值、计分、游戏模式切换以及资源和装备购买等功能,同时处理代码生成、多文件组织、交互逻辑和视觉呈现。

再来看一个赛车游戏的例子,构建这类场景,如赛道延展、前景背景之间的切换,通常对场景延伸能力有较高的要求。IQuest-Q1 能够轻松应对这类具有空间关系和连续交互要求的应用生成。

· 训练诊断与代码修复

IQuest-Q1 也可以进入已有代码和训练环境,定位并修复实际问题。

一次强化学习训练出现异常后,模型根据训练曲线进一步读取日志和执行轨迹,分析可能原因,定位代码中的具体问题并完成修改。训练重新启动后,再通过新的指标变化验证修复结果。正如案例中所展示的,发现根因是 " 训练轨迹中插入了一个空格 ",修复后重新训练,指标恢复上升。

· 复杂工作环境任务执行

IQuest-Q1 可以在包含多类信息和工具的工作环境中执行多步骤任务,并根据任务进展持续读取信息、调用工具和调整结果。

在工作场景中,模型可接入聊天、云文档、表格和评论等信息,综合不同上下文完成分析、文档生成和结果修订,最终形成可直接交付的方案。

可持续的模型迭代机制

IQuest-Q1 采用了 decoder-only Transformer 主干与稀疏 MoE 架构,总参数约 320B、激活参数约 15B。模型训练分为预训练、中期训练和后训练三个阶段,逐步建立基础代码能力,并向复杂任务执行延伸。

后训练阶段,团队围绕软件工程、长时程任务和通用推理对模型开展了专项训练,并通过监督微调和强化学习进一步强化相关能力。同时,通过 Multi-Teacher On-Policy Distillation(MOPD)整合不同教师模型在各类任务上的能力。

此外,经过验证的模型更新、训练资产和研究流程会进入下一轮迭代,并被后续版本直接复用。每轮形成的数据流程、训练配置、评估方法和工具也会持续沉淀,形成模型能力优化与研发流程优化并行推进的迭代机制。

无论是实测中赛车能不能开、游戏能不能玩,还是训练中出现 Bug 能不能及时找到根因。AI 能不能把复杂任务做对、做完,都成为下一次进化的起点。

从此次实践来看,我们观察到至知研究院这个模型赛道新玩家,在代码智能、复杂任务执行和模型自进化等方向上的探索,已经开始呈现出更清晰的技术脉络,这家机构下一步的动态值得持续关注。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 网络安全
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论