田宇航Yuhang Tian

北京理工大学 计算机学院 博士研究生 | 美团 LongCat 基座团队
田宇航

我在北京理工大学读博(导师 宋丹丹 教授),目前在美团 LongCat 基座团队做大模型后训练。

我关心一个问题:模型犯过的错,能不能自动变成它下一次的训练信号? 这需要三件事同时成立 —— 错误要能被自动定位,对错要能被程序化验证, 而验证信号要能精确落到该负责的那几个 token 上。 我的工作基本都围绕这条链路展开:在工业场景里把它跑成闭环,在研究里追问它为什么有效、什么时候失效。

研究主线 Research

01让模型从自己的失败里自动学习

线上模型的失败日志是最诚实、也最被浪费的监督信号。我在 LongCat 上构建了 Bad Case 自动修复 闭环:从用户回流轨迹中做首错定位与失败模式聚类, 由修复 Agent 自主生成 Grader 与训练方案,再自动触发训练与双轨回归评测 —— 单类失败仅需 8 条自动挖掘数据即可修复。同样的思路作用在 Agent 的外部组件上, 就是 Zero Auto Harness:固定基座模型,只让 Harness 自己演化。

02可验证奖励与细粒度信用分配

当奖励可以被程序验证时,真正的难点就从「对不对」转移到了「该怪谁」。 在 ToolAgent-RL 中,我把多轮工具调用轨迹解构为 6,498 个状态-动作决策,设计协议合法性、工具路由与参数精确性三类可验证奖励; 在 Bad Case 闭环中,Token-level Advantage Mask 把序列级优势聚焦到可定位的违规 token、豁免正确部分, 并为全零奖励组注入负向优势 —— 后者直接针对 GRPO 里组内错误共现导致的优势归零问题。 这套做法有没有边界?Executor Signals 用 magnitude-matched 安慰剂对照 拆开了「细粒度归因」与「稠密 shaping」两个混在一起的因素,给出了否定式的答案。

03结构化推理与可执行验证

博士期间的主线。相比让模型直接吐答案,我更关心让它生成可被执行器检验的结构, 从而拿到免费的正确性信号。沿着这条线有 CompKBQA(任务分解 + 工具检索的 Agent 式框架)、 GRV-KBQA(生成-落地-验证三阶段,结构感知过滤 90% 无效候选) 与 Structure-Enhanced LF Generation(子图级检索 + token 预算压缩证据)。

04模型内部机理与诊断

训练之外,我也做一些「打开模型看看」的工作: Cancellation Trap 揭示了稠密余弦相似度会因 SAE 原子的相反贡献相互抵消 而误判去混杂效果,并提出无需训练的 PurPCA; 以及基于深层内部表征的幻觉检测、Probing 分析表征与下游预测信号的层级关联。

经历 Experience

美团 | LongCat 基座团队
2026.05 - 至今
大模型研究工程师
Bad Case 自动修复端到端负责

面向用户回流日志中的高频失败,构建「自发现 - 自诊断 - 自修复 - 自训练 - 自评测」闭环。 我负责端到端设计与落地:失败轨迹分析、首错定位与模式聚类、修复 Agent 设计、 自动 Grader 与 Token-level Advantage Mask 生成、训练方案接入,以及专项与通用能力回归评测。

效果:纯 JSON 规范性 77.53% → 99.78%; Markdown 围栏显式 / 隐式模式分别 34.29% → 77.96%55.56% → 88.89%; 目标失败占比 39.5% → 2.0%;Mask 相比 No-Mask 专项指标高约 7 个百分点, 同时 9 项 General 宏平均无退化(61.19% → 61.33%)。

Zero Auto Harness

固定基座模型,从仅含 run_shell_command 的最小 Harness 出发, 基于执行轨迹与评测反馈自动演化 Tool Implementation 与 Middleware。 参与搭建 work / evolve 双 Agent 闭环;针对 evolve agent 易记忆评测任务的问题, 参与设计全局泛化约束,将任务相关修改抽象为跨任务复用规则,并对候选 Harness 分轨复评测。

效果:固定 GPT-5.4、经 5 轮演化,SWE-bench Verified 500-task Pass@1 51.8% → 61.0%

上海文谛资产管理 | 量化研究
2021.06 - 2025.06
大模型研究工程师

量化研究 Agent:搭建多 Agent 系统串联策略生成、代码执行与自动回测, 以沙盒回测结果作为可验证评估信号,自动筛选并迭代候选 Alpha 因子 —— 这是我最早接触 「用可执行结果替代人工标注」的场景。

NLP 情感因子与生产部署:主导研报摘要与市场情绪的多维因子建模, 围绕文本截断、类别不平衡、名称干扰与因子共线性优化数据和模型,多版本迭代并上线实盘策略。

RAG 与表征分析:落地语义切分、稠密 / 稀疏混合检索、Milvus 向量检索、LLM 重排与归因链路。

教育背景 Education

北京理工大学 · 计算机科学与技术
博士研究生 | 导师:宋丹丹 教授(青年长江学者)
2021.09 - 2027.06
研究生特等奖学金 · 校优秀学生
北京理工大学 · 计算机科学与技术
工学学士
2017.09 - 2021.06
ACM-ICPC 亚洲区域赛银牌 · 全国团队程序设计天梯赛银奖 · 国家励志奖学金

论文 Publications

共 15 篇,其中第一作者 6 篇。完整列表亦见 Google Scholar

第一作者 · First-authored
Structure-Enhanced Logical Form Generation for KBQA
Yuhang Tian, et al.
ACL 2026 | 第一作者
结构感知检索框架:结合子图级检索与 token 预算压缩结构化证据,通过 SFT 生成可执行 Logical Form。
Where Executor Signals Pay Off in Verifiable KBQA: A Placebo-Controlled Study of Reward Granularity and Placement
Yuhang Tian, et al.
AAAI 2027 在投 | 第一作者
构造逐约束 necessity 信号与 magnitude-matched shuffled placebo,解耦「细粒度归因」与「稠密 shaping」两个常被混淆的因素;界定约束级 reward shaping 在训练期的适用边界 —— 而同样的 executor 用在推理期一致性选择时带来 +9.5 F1
The Cancellation Trap: Sparse Diagnostics for Hidden Confounds in Cultural Value Steering
Yuhang Tian, et al.
AAAI 2027 在投 | 第一作者
稠密余弦会因 SAE 原子的相反贡献相互抵消而误判去混杂效果;提出无需训练的 PurPCA,在三种架构的六个文化维度上均取得正向 steering spread。
CompKBQA: Component-wise Task Decomposition for KBQA
Yuhang Tian, et al.
EMNLP 2025 | 第一作者
「任务分解 + 工具检索」的 Agent 式框架,以骨架、实体、关系、逻辑形式四阶段链式 SFT 学习子任务,并通过 R³ 检索动态注入外部知识。
GRV-KBQA: Decoupled Logical Structure Generation, Grounding and Verification
Yuhang Tian, et al.
EMNLP 2025 | 第一作者
生成 - 落地 - 验证三阶段 pipeline,以 LoRA 解耦模板生成与语义填充,通过结构感知过滤 90% 无效候选。
Augmenting Reasoning Capabilities of LLMs with Graph Structures in KBQA
Yuhang Tian, et al.
EMNLP 2024 | 第一作者
无监督两阶段排序器结合图上多跳束搜索,动态检索推理路径,在 GrailQA zero-shot 上提升 8.1 EM
合作论文 · Co-authored
A Fact-Checking Framework with Denoising Evidence Retrieval and LLM-Based Debate Verification
WWW 2026
Multi-Hop Knowledge Editing via Critic-Guided Multi-Agent Reasoning
ACL 2026
Static Models, Dynamic World: A Unified Perspective on Temporal Perception in Large Language Models
ACL 2026
ActiShade: Activating Overshadowed Knowledge to Guide Multi-Hop Reasoning in Large Language Models
AAAI 2026
Path-enhanced Pre-trained Language Model for Knowledge Graph Completion
EMNLP 2025
Detecting Hallucination in Large Language Models Through Deep Internal Representation Analysis
IJCAI 2025
A Framework of Knowledge Graph-Enhanced Large Language Model Based on Question Decomposition and Atomic Retrieval
EMNLP 2024
Span-Pair Interaction and Tagging for Dialogue-Level Aspect-Based Sentiment Quadruple Analysis
WWW 2024
A Framework of Knowledge Graph-Enhanced Large Language Model Based on Global Planning
IEEE TKDE | 期刊

学术服务与其他 Service & More

Area Chair
ACL Rolling Review(同时为 ARR 团队成员)
审稿人
ACL · EMNLP · NAACL · NeurIPS · AAAI · CIKM · CCKS · KBS · ESWA
社区
MLNLP 学生委员
技术栈
GRPO / RLHF 后训练 · 多轮工具调用 Agent · 可验证奖励设计 · 大规模评测与回归 · RAG 与混合检索 · SAE / Probing 表征分析
博客
GuguMelon's Blog —— 2018 年至今的技术笔记与随笔,算法、工具与阅读记录。
合作
后训练中的信用分配Agent 自进化可验证奖励相关的合作与讨论都很感兴趣,欢迎邮件联系。