01让失败自动进入下一轮训练
线上失败日志往往停留在分析阶段,难以转化为训练数据。我构建 Bad Case 自动修复闭环: 以首错定位和模式聚类归纳问题,由修复 Agent 生成 Grader 与训练方案,再自动触发训练和双轨回归。 单类失败仅使用8 条自动挖掘数据,目标失败占比从 39.5% 降至 2.0%。 Zero Auto Harness把同一思路延伸到 Agent 外部系统: 冻结基座模型,依据执行反馈演化工具与中间件。
北京理工大学计算机学院博士研究生
美团 LongCat 基座团队
我在北京理工大学计算机学院攻读博士学位(导师:宋丹丹教授), 同时在美团 LongCat 基座团队从事大模型后训练研究。
我关注一个问题:模型犯过的错,能否自动变成下一轮学习信号? 我的工作串联错误定位、程序化验证与细粒度信用分配,在工业系统中把它们落成可持续的训练闭环, 并在研究中检验其有效边界。当前兴趣包括大模型后训练、可验证强化学习、Agent 自进化与结构化推理。
线上失败日志往往停留在分析阶段,难以转化为训练数据。我构建 Bad Case 自动修复闭环: 以首错定位和模式聚类归纳问题,由修复 Agent 生成 Grader 与训练方案,再自动触发训练和双轨回归。 单类失败仅使用8 条自动挖掘数据,目标失败占比从 39.5% 降至 2.0%。 Zero Auto Harness把同一思路延伸到 Agent 外部系统: 冻结基座模型,依据执行反馈演化工具与中间件。
程序化验证能回答「对不对」,却未必指出「错在哪里」。在 ToolAgent-RL中,我把多轮工具调用轨迹拆成 6,498 个状态—动作决策,并分别验证协议、工具路由与参数。 在 Bad Case 闭环中,Token-level Advantage Mask 将序列级优势聚焦到违规 token, 专项指标较无 Mask 方案提高约7 个百分点,同时尽量保留原本正确的片段。
与其让模型直接输出答案,我更关心生成可由执行器检验的结构,从执行结果中获得监督。 CompKBQA以任务分解和知识检索逐步学习逻辑形式; GRV-KBQA解耦结构生成、语义落地与验证, 结构感知验证可过滤 90% 的无效候选; SELF-KBQA则结合子图检索与 token 预算约束, 为生成阶段提供紧凑、结构对齐的证据。
我也从内部表征解释模型为何失效。 相关工作包括基于深层内部表征的幻觉检测,以及用 Probing 分析不同层级的表征与预测信号。
问题:高频线上失败依赖人工定位和逐类修补,难以规模化。 方法:构建「发现—诊断—修复—训练—评测」闭环,覆盖首错定位、模式聚类、 修复 Agent、自动 Grader、Token-level Advantage Mask 与回归评测。
结果:纯 JSON 规范性从 77.53% 提升至 99.78%, 目标失败占比从 39.5% 降至 2.0%; Mask 方案较无 Mask 方案高约 7 个百分点,9 项通用能力宏平均无退化。
问题:Agent 的工具和中间件通常依赖人工设计,容易针对评测集过拟合。
方法:固定基座模型,从仅含 run_shell_command 的最小 Harness 出发,
用 work / evolve 双 Agent 根据执行轨迹演化 Tool Implementation 与 Middleware,
再以全局泛化约束和分轨复评测筛选候选方案。
结果:固定 GPT-5.4、经过 5 轮演化,SWE-bench Verified 500-task Pass@1 从 51.8% 提升至 61.0%。
搭建多 Agent 研究系统,串联策略生成、代码执行与自动回测, 将沙盒回测结果转化为 Alpha 因子的自动筛选和迭代信号。
主导研报摘要与市场情绪因子建模,围绕长文本截断、类别不平衡、名称干扰与因子共线性迭代模型并上线实盘; 同时落地语义切分、稠密 / 稀疏混合检索、Milvus、LLM 重排与归因链路。
共 13 篇,其中第一 / 共同第一作者 4 篇。完整列表见 Google Scholar。 * 表示共同第一作者。
提出 SELF-KBQA:以结构感知子图检索和 token 预算证据压缩,为可执行逻辑形式生成提供紧凑上下文。
将逻辑形式生成分解为骨架、主题实体、关系与完整形式四个子任务,并用 R³ 动态检索知识库信息。
解耦逻辑结构生成、语义落地与结构感知验证,以知识库约束过滤不可执行或结构不一致的候选。
以无监督两阶段排序器和图上多跳束搜索检索推理路径,在 GrailQA zero-shot 上提升 8.1 EM。