首页 / 资讯中心 / 文章详情

大模型又一新玩家,至知创新研究院发布并开源 IQuest-Q1

大模型又一新玩家,至知创新研究院发布并开源 IQuest-Q1 ★ FEATURED ARTICLE
9月29日至知创新研究院IQuest Research发布并开源 IQuest-Q1。模型重点面向代码、软件工程与复杂任务执行在训练过程中进一步覆盖推理、工具使用、长上下文理解及多步任务处理等能力。多场景任务中的能力验证IQuest-Q1 的训练重点覆盖从代码生成到智能体任务并延伸至工具调用、信息搜索、长上下文理解和复杂环境中的多步执行。模型可在任务过程中持续理解上下文、调用工具、处理反馈并完成可验证的最终结果。在涵盖代码、软件工程、终端操作、工具使用和复杂智能体任务等多个领域的标准评测中IQuest-Q1 均展现出均衡稳健的性能。其中IQuest-Q1 在仓库级代码生成基准 NL2Repo 和网络安全基准 CyberGym 上展现出一定能力同时在 Terminal-Bench 2.1、代码长程任务基准 DeepSWE v1.1以及面向专业办公场景的 JobBench 等复杂任务评测中也表现出较好的任务执行能力。具体到实际任务可以一起看下在几个典型场景中的实测。· 复杂交互应用开发在前端开发中用户输入自然语言指令后模型可以直接生成可运行的交互应用。以 FPS 游戏为例IQuest-Q1 可以一次完成三维场景、角色移动、生命值、计分、游戏模式切换以及资源和装备购买等功能同时处理代码生成、多文件组织、交互逻辑和视觉呈现。再来看一个赛车游戏的例子构建这类场景如赛道延展、前景背景之间的切换通常对场景延伸能力有较高的要求。IQuest-Q1 能够轻松应对这类具有空间关系和连续交互要求的应用生成。· 训练诊断与代码修复IQuest-Q1 也可以进入已有代码和训练环境定位并修复实际问题。一次强化学习训练出现异常后模型根据训练曲线进一步读取日志和执行轨迹分析可能原因定位代码中的具体问题并完成修改。训练重新启动后再通过新的指标变化验证修复结果。正如案例中所展示的发现根因是“训练轨迹中插入了一个空格”修复后重新训练指标恢复上升。· 复杂工作环境任务执行IQuest-Q1 可以在包含多类信息和工具的工作环境中执行多步骤任务并根据任务进展持续读取信息、调用工具和调整结果。在工作场景中模型可接入聊天、云文档、表格和评论等信息综合不同上下文完成分析、文档生成和结果修订最终形成可直接交付的方案。模型权重与Blog已同步发布。GitHubhttps://github.com/IQuestLab/IQuest-Q1Hugging Facehttps://huggingface.co/IQuestLab/IQuest-Q1Bloghttps://iquestlab.github.io/可持续的模型迭代机制IQuest-Q1 采用了 decoder-only Transformer 主干与稀疏 MoE 架构总参数约 320B、激活参数约 15B。模型训练分为预训练、中期训练和后训练三个阶段逐步建立基础代码能力并向复杂任务执行延伸。后训练阶段团队围绕软件工程、长时程任务和通用推理对模型开展了专项训练并通过监督微调和强化学习进一步强化相关能力。同时通过 Multi-Teacher On-Policy DistillationMOPD整合不同教师模型在各类任务上的能力。此外经过验证的模型更新、训练资产和研究流程会进入下一轮迭代并被后续版本直接复用。每轮形成的数据流程、训练配置、评估方法和工具也会持续沉淀形成模型能力优化与研发流程优化并行推进的迭代机制。无论是实测中赛车能不能开、游戏能不能玩还是训练中出现Bug能不能及时找到根因。AI能不能把复杂任务做对、做完都成为下一次进化的起点。从此次实践来看我们观察到至知研究院这个模型赛道新玩家在代码智能、复杂任务执行和模型自进化等方向上的探索已经开始呈现出更清晰的技术脉络这家机构下一步的动态值得持续关注。
阅读完成 · 觉得有帮助?
咨询建站