你好,我是 Yaxin Luo。

关于我
Decorative animated background
我是 Yaxin Luo,目前是 MBZUAI 机器学习方向一年级博士生,导师是 Prof. Zhiqiang Shen。我也与好友 Xiaofu Chen 保持紧密合作。 我的研究聚焦于多模态输入—多模态输出智能体系统(Multimodal-in and Multimodal-out Agentic Systems)递归式自我改进智能体系统(Recursive Self-improvement Agentic Systems)这两个相互补充的方向:一方面构建统一多模态理解、生成、推理、规划与行动的模型和系统;另一方面探索如何基于 rollout experience,让模型参数与外围的智能体基础设施协同演化。
在攻读博士之前,我本科毕业于 Technical University of Denmark,曾受 Prof. Dim P. Papadopoulos 指导。本科期间,我也与 Dr. Gen LuoProf. Rongrong Ji 合作开展高效深度学习相关研究。这些经历让我持续关注高效、可扩展,并且能够服务真实世界任务的智能系统。

我的研究兴趣主要集中在:

  • 多模态输入—多模态输出智能体系统:我关注能够理解异构多模态输入并生成多模态输出的智能体系统,在统一框架中整合理解、生成、推理、规划与行动。我尤其关注能够支持长程交互以及结构化、可编辑内容生成的原生多模态基础模型。
  • 递归式自我改进智能体系统:我关注能够从 rollout trajectories 和 accumulated experience 中递归改进的智能体系统。在这类系统中,模型参数与外围的智能体基础设施——包括 harnesses、tools、memory、orchestration、evaluation 和 feedback loops——共同作为优化目标并协同演化,而不是将模型或其 scaffold 中的任何一方视为固定不变。
最近,我主要关注面向长程交互任务的多模态智能体基础模型与系统,尤其是 Agentic Design、Recursive Self-improvement Agentic Systems 和 Infrastructure Frameworks。
经历
Research Intern, Meituan LongCat Team
2026 年 4 月至今 · 北京,中国
参与 Unified Multimodal Foundation Model Projects (LongCat-Next Team)
  • 面向统一多模态模型的长程多模态交互任务:Agentic Design System
  • 面向理解与生成统一建模的离散视觉编码器。
Research Assistant, MBZUAI
2025 年 1 月 - 2025 年 8 月 · 阿布扎比,阿联酋
在 VILA Lab 由 Prof. Zhiqiang Shen 指导。
  • 研究 language-pretraining-induced bias 如何作为通用视觉任务的强先验,展示 LLM 先验向纯视觉学习迁移的可能性,该工作发表于 TMLR 2026
  • 探索多模态大语言模型(MLLMs)中的推理与智能体行为,主导 OpenCaptchaWorld benchmark(NeurIPS 2025)。

最新动态

[2026-08-13] AutoDesign 已上线 arXiv。该工作提出面向长程智能体设计的 Meta-Harness Optimization 框架,并同步开放了源代码在线演示
[2026-02-10] Next-Gen CAPTCHAs 已上线 arXiv。这是一套利用认知差异构建可扩展、多样化 GUI-Agent 防御任务的框架。
[2025-09-18] OpenCaptchaWorld 被 NeurIPS 2025 接收。

代表论文

(* 表示共同一作)

完整且最新的论文列表请参考我的 Google Scholar 主页。

AutoDesign 项目概览
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
arXiv 2026
Yaxin Luo *, Haobin Jiang *, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
论文 代码 演示 项目主页
Next-Gen CAPTCHAs project figure
Next-Gen CAPTCHAs: Leveraging the Cognitive Gap for Scalable and Diverse GUI-Agent Defense
arXiv 2026
Jiacheng Liu *, Yaxin Luo *, Jiacheng Cui, Xinyi Shang, Xiaohan Zhao, Zhiqiang Shen
论文 代码 演示 项目主页
OpenCaptchaWorld project figure
OpenCaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents
NeurIPS 2025
Yaxin Luo *, Zhaoyi Li *, Jiacheng Liu, Jiacheng Cui, Xiaohan Zhao, Zhiqiang Shen
论文 代码 演示
APL paper figure
APL: Anchor-Based Prompt Learning for One-Stage Weakly Supervised Referring Expression Comprehension
ECCV 2024
Yaxin Luo, Jiayi Ji, Xiaofu Chen, Yuxin Zhang, Tianhe Ren, Gen Luo
论文 代码
gamma-MoD paper figure
γ-MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
ICLR 2025
Yaxin Luo, Gen Luo, Jiayi Ji, Yiyi Zhou, Xiaoshuai Sun, Zhiqiang Shen, Rongrong Ji
论文 代码