田宇航 Yuhang Tian

北京理工大学计算机学院博士研究生
美团 LongCat 基座团队

田宇航的个人照片

我在北京理工大学计算机学院攻读博士学位(导师:宋丹丹教授), 同时在美团 LongCat 基座团队从事大模型后训练研究。

我关注一个问题:模型犯过的错,能否自动变成下一轮学习信号? 我的工作串联错误定位、程序化验证与细粒度信用分配,在工业系统中把它们落成可持续的训练闭环, 并在研究中检验其有效边界。当前兴趣包括大模型后训练、可验证强化学习、Agent 自进化与结构化推理。

研究主线 Research

01让失败自动进入下一轮训练

线上失败日志往往停留在分析阶段,难以转化为训练数据。我构建 Bad Case 自动修复闭环: 以首错定位和模式聚类归纳问题,由修复 Agent 生成 Grader 与训练方案,再自动触发训练和双轨回归。 单类失败仅使用8 条自动挖掘数据,目标失败占比从 39.5% 降至 2.0%Zero Auto Harness把同一思路延伸到 Agent 外部系统: 冻结基座模型,依据执行反馈演化工具与中间件。

02可验证奖励与细粒度信用分配

程序化验证能回答「对不对」,却未必指出「错在哪里」。在 ToolAgent-RL中,我把多轮工具调用轨迹拆成 6,498 个状态—动作决策,并分别验证协议、工具路由与参数。 在 Bad Case 闭环中,Token-level Advantage Mask 将序列级优势聚焦到违规 token, 专项指标较无 Mask 方案提高约7 个百分点,同时尽量保留原本正确的片段。

03结构化推理与可执行验证

与其让模型直接输出答案,我更关心生成可由执行器检验的结构,从执行结果中获得监督。 CompKBQA以任务分解和知识检索逐步学习逻辑形式; GRV-KBQA解耦结构生成、语义落地与验证, 结构感知验证可过滤 90% 的无效候选; SELF-KBQA则结合子图检索与 token 预算约束, 为生成阶段提供紧凑、结构对齐的证据。

04模型内部机理与诊断

我也从内部表征解释模型为何失效。 相关工作包括基于深层内部表征的幻觉检测,以及用 Probing 分析不同层级的表征与预测信号。

经历 Experience

美团 | LongCat 基座团队
2026.05 – 至今
大模型研究工程师
Bad Case 自动修复 端到端负责

问题:高频线上失败依赖人工定位和逐类修补,难以规模化。 方法:构建「发现—诊断—修复—训练—评测」闭环,覆盖首错定位、模式聚类、 修复 Agent、自动 Grader、Token-level Advantage Mask 与回归评测。

结果:纯 JSON 规范性从 77.53% 提升至 99.78%, 目标失败占比从 39.5% 降至 2.0%; Mask 方案较无 Mask 方案高约 7 个百分点,9 项通用能力宏平均无退化。

Zero Auto Harness

问题:Agent 的工具和中间件通常依赖人工设计,容易针对评测集过拟合。 方法:固定基座模型,从仅含 run_shell_command 的最小 Harness 出发, 用 work / evolve 双 Agent 根据执行轨迹演化 Tool Implementation 与 Middleware, 再以全局泛化约束和分轨复评测筛选候选方案。

结果:固定 GPT-5.4、经过 5 轮演化,SWE-bench Verified 500-task Pass@1 从 51.8% 提升至 61.0%

上海文谛资产管理 | 量化研究
2021.06 – 2025.06
大模型研究工程师
量化研究 Agent 与 NLP 系统

搭建多 Agent 研究系统,串联策略生成、代码执行与自动回测, 将沙盒回测结果转化为 Alpha 因子的自动筛选和迭代信号。

主导研报摘要与市场情绪因子建模,围绕长文本截断、类别不平衡、名称干扰与因子共线性迭代模型并上线实盘; 同时落地语义切分、稠密 / 稀疏混合检索、Milvus、LLM 重排与归因链路。

教育背景 Education

北京理工大学 · 计算机科学与技术
博士研究生|导师:宋丹丹教授(青年长江学者)
2021.09 – 预计 2027.06
研究生特等奖学金 · 校优秀学生
北京理工大学 · 计算机科学与技术
工学学士
2017.09 – 2021.06
ACM-ICPC 亚洲区域赛银牌 · 全国团队程序设计天梯赛银奖 · 国家励志奖学金

论文 Publications

共 13 篇,其中第一 / 共同第一作者 4 篇。完整列表见 Google Scholar。 * 表示共同第一作者。

第一 / 共同第一作者
Subgraph-Guided Executable Logical Form Generation for Knowledge Base Question Answering
Yuhang Tian, et al.
ACL 2026|第一作者

提出 SELF-KBQA:以结构感知子图检索和 token 预算证据压缩,为可执行逻辑形式生成提供紧凑上下文。

CompKBQA: Component-wise Task Decomposition for Knowledge Base Question Answering
Yuhang Tian, et al.
EMNLP 2025|第一作者

将逻辑形式生成分解为骨架、主题实体、关系与完整形式四个子任务,并用 R³ 动态检索知识库信息。

GRV-KBQA: A Three-Stage Framework for Knowledge Base Question Answering with Decoupled Logical Structure, Semantic Grounding and Structure-Aware Validation
Yuhang Tian*, Pan Yang*, et al.
EMNLP 2025|共同第一作者

解耦逻辑结构生成、语义落地与结构感知验证,以知识库约束过滤不可执行或结构不一致的候选。

Augmenting Reasoning Capabilities of LLMs with Graph Structures in Knowledge Base Question Answering
Yuhang Tian, et al.
EMNLP 2024|第一作者

以无监督两阶段排序器和图上多跳束搜索检索推理路径,在 GrailQA zero-shot 上提升 8.1 EM。

合作论文
A Fact-Checking Framework with Denoising Evidence Retrieval and LLM-Based Debate Verification
WWW 2026
Multi-Hop Knowledge Editing via Critic-Guided Multi-Agent Reasoning
ACL 2026
Static Models, Dynamic World: A Unified Perspective on Temporal Perception in Large Language Models
ACL 2026
ActiShade: Activating Overshadowed Knowledge to Guide Multi-Hop Reasoning in Large Language Models
AAAI 2026
Path-enhanced Pre-trained Language Model for Knowledge Graph Completion
EMNLP 2025
Detecting Hallucination in Large Language Models Through Deep Internal Representation Analysis
IJCAI 2025
A Framework of Knowledge Graph-Enhanced Large Language Model Based on Question Decomposition and Atomic Retrieval
EMNLP 2024
Span-Pair Interaction and Tagging for Dialogue-Level Aspect-Based Sentiment Quadruple Analysis
WWW 2024
A Framework of Knowledge Graph-Enhanced Large Language Model Based on Global Planning
IEEE TKDE|期刊

学术服务与其他 Service & More

领域主席
ACL Rolling Review Area Chair,同时为 ARR 团队成员
审稿人
ACL · EMNLP · NAACL · NeurIPS · AAAI · CIKM · CCKS · KBS · ESWA
社区
MLNLP 学生委员
技术方向
GRPO / RLHF 后训练 · 多轮工具调用 Agent · 可验证奖励与信用分配 · 大规模评测与回归 · RAG 与混合检索 · SAE / Probing 表征分析
博客
GuguMelon's Blog——2018 年至今的算法、工具、阅读笔记与随笔。
合作
欢迎围绕后训练信用分配、Agent 自进化与可验证奖励交流合作,也欢迎邮件联系。