Researcher · LLM & Multi-Agent Systems

黄奕天 Yitian Huang

大语言模型 · 模型评估 · 泛化与基准偏差 · 社会模拟 · 多智能体系统

研究兴趣

我关注大语言模型在评估、社会推理与多智能体协作中的能力与局限。 曾在微软亚洲研究院社会计算组实习,参与 LLM 长上下文压缩、情感智能与心理理论推理、 以及多智能体博弈等方向的研究与产品落地。

教育背景

深圳大学

2021.09 – 2025.06 · 深圳

软件工程学士;辅修:人工智能

  • 平均学分绩点 (GPA): 82.6 / 100
  • 2021.09 – 2022.09 就读于自动化专业,后转入软件工程专业

潮州金山中学

2018.09 – 2021.06 · 潮州

高中

发表论文

Nature 2026

General Scales Unlock AI Evaluation with Explanatory and Predictive Power

Lexin Zhou, Lorenzo Pacchiardi, Fernando Martínez-Plumed, Katherine M. Collins, Yael Moros-Daval, Seraphina Zhang, Qinlin Zhao, Yitian Huang, Luning Sun, Jonathan E. Prunty, Zongqian Li, Pablo Sánchez-García, Kexin Jiang-Chen, Pablo A. M. Casares, Jiyun Zu, John Burden, Behzad Mehrbakhsh, David Stillwell, Manuel Cebrian, Jindong Wang, Peter Henderson, Sherry Tongshuang Wu, Patrick C. Kyllonen, Lucy Cheke, Xing Xie, José Hernández-Orallo

Nature, 652:58–67, 2026

ACL 2025

Pretraining Context Compressor for Large Language Models with Embedding-Based Memory

Yuhong Dai, Jianxun Lian, Yitian Huang, Wei Zhang, Mingyang Zhou, Mingqi Wu, Xing Xie, Hao Liao

ACL 2025 Long Paper, pages 28715–28732

EMNLP 2025

Interactive AI NPCs Powered by LLMs: Technical Report for the CPDC Challenge 2025

Yitian Huang, Yuxuan Lei, Jianxun Lian, Hao Liao

EMNLP 2025 Wordplay Workshop

科研经历

微软亚洲研究院 (MSRA) · 社会计算组

2024.07 – 2025.08 · 北京

研究实习生 · 导师:练建勋

  • 情感智能与心理理论推理: 从小说和叙事文本生成合成场景数据,探索 SFT 与 RL(结果/轨迹奖励)提升 LLM 社会与情感推理能力。
  • 评估与数据构建: 构建可复用评估流水线、RL 训练框架及细粒度数据集,用于社会推理与泛化分析。
  • 竞赛与模型博弈: 带队参加 CPDC 2025(6 赛道中 4 个前三)与 MindGames 2025(NeurIPS 子竞赛第 3 名),研究多智能体博弈中的心理理论推理。
  • 产品落地: 与 Xbox 团队合作,将 LLM Agent 集成到游戏通行证推荐与工具增强流水线(SQL、检索、搜索、长期记忆)。
  • 长上下文压缩: 提出基于嵌入的结构化输入压缩方法,显著降低上下文长度与计算成本,成果发表于 ACL 2025。

荣誉与奖项