我在北京理工大学读博(导师 宋丹丹 教授),目前在美团 LongCat 基座团队做大模型后训练。
我关心一个问题:模型犯过的错,能不能自动变成它下一次的训练信号? 这需要三件事同时成立 —— 错误要能被自动定位,对错要能被程序化验证, 而验证信号要能精确落到该负责的那几个 token 上。 我的工作基本都围绕这条链路展开:在工业场景里把它跑成闭环,在研究里追问它为什么有效、什么时候失效。
线上模型的失败日志是最诚实、也最被浪费的监督信号。我在 LongCat 上构建了 Bad Case 自动修复 闭环:从用户回流轨迹中做首错定位与失败模式聚类, 由修复 Agent 自主生成 Grader 与训练方案,再自动触发训练与双轨回归评测 —— 单类失败仅需 8 条自动挖掘数据即可修复。同样的思路作用在 Agent 的外部组件上, 就是 Zero Auto Harness:固定基座模型,只让 Harness 自己演化。
当奖励可以被程序验证时,真正的难点就从「对不对」转移到了「该怪谁」。 在 ToolAgent-RL 中,我把多轮工具调用轨迹解构为 6,498 个状态-动作决策,设计协议合法性、工具路由与参数精确性三类可验证奖励; 在 Bad Case 闭环中,Token-level Advantage Mask 把序列级优势聚焦到可定位的违规 token、豁免正确部分, 并为全零奖励组注入负向优势 —— 后者直接针对 GRPO 里组内错误共现导致的优势归零问题。 这套做法有没有边界?Executor Signals 用 magnitude-matched 安慰剂对照 拆开了「细粒度归因」与「稠密 shaping」两个混在一起的因素,给出了否定式的答案。
博士期间的主线。相比让模型直接吐答案,我更关心让它生成可被执行器检验的结构, 从而拿到免费的正确性信号。沿着这条线有 CompKBQA(任务分解 + 工具检索的 Agent 式框架)、 GRV-KBQA(生成-落地-验证三阶段,结构感知过滤 90% 无效候选) 与 Structure-Enhanced LF Generation(子图级检索 + token 预算压缩证据)。
训练之外,我也做一些「打开模型看看」的工作: Cancellation Trap 揭示了稠密余弦相似度会因 SAE 原子的相反贡献相互抵消 而误判去混杂效果,并提出无需训练的 PurPCA; 以及基于深层内部表征的幻觉检测、Probing 分析表征与下游预测信号的层级关联。
面向用户回流日志中的高频失败,构建「自发现 - 自诊断 - 自修复 - 自训练 - 自评测」闭环。 我负责端到端设计与落地:失败轨迹分析、首错定位与模式聚类、修复 Agent 设计、 自动 Grader 与 Token-level Advantage Mask 生成、训练方案接入,以及专项与通用能力回归评测。
效果:纯 JSON 规范性 77.53% → 99.78%; Markdown 围栏显式 / 隐式模式分别 34.29% → 77.96%、55.56% → 88.89%; 目标失败占比 39.5% → 2.0%;Mask 相比 No-Mask 专项指标高约 7 个百分点, 同时 9 项 General 宏平均无退化(61.19% → 61.33%)。
固定基座模型,从仅含 run_shell_command 的最小 Harness 出发,
基于执行轨迹与评测反馈自动演化 Tool Implementation 与 Middleware。
参与搭建 work / evolve 双 Agent 闭环;针对 evolve agent 易记忆评测任务的问题,
参与设计全局泛化约束,将任务相关修改抽象为跨任务复用规则,并对候选 Harness 分轨复评测。
效果:固定 GPT-5.4、经 5 轮演化,SWE-bench Verified 500-task Pass@1 51.8% → 61.0%。
量化研究 Agent:搭建多 Agent 系统串联策略生成、代码执行与自动回测, 以沙盒回测结果作为可验证评估信号,自动筛选并迭代候选 Alpha 因子 —— 这是我最早接触 「用可执行结果替代人工标注」的场景。
NLP 情感因子与生产部署:主导研报摘要与市场情绪的多维因子建模, 围绕文本截断、类别不平衡、名称干扰与因子共线性优化数据和模型,多版本迭代并上线实盘策略。
RAG 与表征分析:落地语义切分、稠密 / 稀疏混合检索、Milvus 向量检索、LLM 重排与归因链路。
共 15 篇,其中第一作者 6 篇。完整列表亦见 Google Scholar。