Issue 描述不完整
只有现象,缺少复现步骤、运行环境或预期行为。
Agent 可能误解需求,从错误的问题定义开始实现。
查找上下文,明确列出仍需补充的信息。
在 Coding Agent 开始写代码之前,
先验证需求、历史上下文与代码证据,再决定是否进入开发。
Coding Agent 最危险的问题,往往不是不会写代码,而是在信息还不够的时候就开始写代码。
只有现象,缺少复现步骤、运行环境或预期行为。
Agent 可能误解需求,从错误的问题定义开始实现。
查找上下文,明确列出仍需补充的信息。
检索找到相似文件,不代表知道该怎样修改。
可能改错模块,或为一个小问题扩大实现范围。
交叉核对源码、文档、评论与历史 Issue,建立证据链。
生成一份方案,不能证明现在就应该开始开发。
缺少代码依据、测试计划或验收标准时,结论不安全。
用最终准入检查,把模型建议与开发许可分开。
粘贴公开 GitHub Issue 链接。先查真实依据,再判断是进入开发、补充信息,还是交给维护者确认。
先了解用户到底报告了什么问题。
去源码、文档、评论和历史 Issue 找依据。
确认是否知道问题是什么、该改哪里、怎么验证。
模型觉得可以做,也要再检查代码、测试和验收条件。
明确应该开发、补信息、看文档,还是人工确认。
当前请求不是 streaming。以下为流程说明,完整运行记录会在结果返回后展示。
本次请求耗时:0.0s
22 个真实 GitHub Issue,人工逐条审核。公开判断正确的地方,也公开系统过于保守的地方。
安全违规为 0,但 ready_for_coding 为 0 / 5,说明系统仍偏保守。
needs_infoready_for_codingdocs_help开发路线 0 / 5:应被放行的案例未能正确进入开发。
在这次冻结评测中,未观察到以下四类违规。
安全指标为本次样本观察,不代表所有使用场景下零风险。
系统能在信息不足时停下来,却也拦住了应当进入开发的 Issue。安全验证与路线准确率需要同时解读。
证据约束和准入边界有效。
ready_for_coding 0 / 5 暴露了过度保守。
最终结果由 Human Gold 对照,不用模型自评替代人工判断。
系统架构
一个单智能体,完成从问题理解到开发准入的判断。检索提供依据,规则控制边界,维护者保留最终决定。
Single-Agent · Evidence-aware · Read-only原始反馈可能不完整。
先理解问题,再决定需要什么依据。
读取问题与上下文
确定证据需求
调用真实信息源
判断证据是否足够
给出下一步建议
依据返回 Agent,支持充分性判断与后续决策。
足够解释问题
不等于足够开始开发
代码依据与实现目标
实现步骤、测试与验收条件
先补齐信息、核对文档或人工复核关联。
needs_infodocs_helpHuman Review · HITL准备实现与验证方案,仍由维护者确认。
ready_for_coding允许进入开发图示呈现系统职责与证据流向。单次分析会按问题和证据情况选择工具,不代表每次运行都执行全部步骤。
保持单智能体编排,让每一次检索、评估和停止都有清晰的审计路径。
单智能体状态机,管理观察、规划、检索、评估与决策。
接收分析请求,承载异步执行与结构化结果。
支持检索规划与结果合成,最终结论仍受准入约束。
结合关键词与语义检索,融合多种来源的相关证据。
读取 Issue、历史讨论、文档和源码,保留可回溯证据。
明确自动化边界,以人工审核基准检查路线与能力。
项目介绍 IssueGate 产品设计案例
从一个 GitHub Issue 分诊原型,到有证据、有边界的开发准入 Agent。这个项目的演进,始终围绕一个问题:什么时候,信息已经足够支持行动?
一个 Issue 可能缺少复现步骤、预期行为或影响范围。即使检索到了相关代码,也不代表已经知道该改哪里、怎么验证,更不代表现在就应该开始开发。
在 GitHub Issue 与 Coding Agent 之间加入一道开发准入判断:先查真实依据,再确认开发条件,最后给出下一步。
每一次变化,都回应一个具体的判断风险。
ready_for_coding 仅命中 0 / 5。最终冻结评测
22 条人工审核真实 Issue
0 / 5
ready_for_coding 路线命中
应该进入开发的案例没有被正确放行,说明系统仍然过于保守。
整体主路线准确率为 63.6%(14 / 22)。这是人工筛选并审核的基准结果,不代表生产流量分布;安全指标为本次冻结运行中的观测结果。
查看完整评测与路线表现开发准入校准
Readiness Calibration
接下来应回到被漏判的 ready_for_coding 案例,逐项检查:是证据获取不足,还是准入条件过严。沿用可追溯的证据与人工判断校准门槛,同时持续验证是否引入新的无依据开发。
这是下一阶段的产品重点,尚未作为已完成能力或新增评测结果展示。