你好,我是 Yaxin Luo。
关于我
Decorative animated background
我是 Yaxin Luo,目前是 MBZUAI 机器学习方向一年级博士生,导师是 Prof. Zhiqiang Shen。我也与好友 Xiaofu Chen 保持紧密合作。 我的研究聚焦于多模态输入—多模态输出智能体系统(Multimodal-in and Multimodal-out Agentic Systems)和递归式自我改进智能体系统(Recursive Self-improvement Agentic Systems)这两个相互补充的方向:一方面构建统一多模态理解、生成、推理、规划与行动的模型和系统;另一方面探索如何基于 rollout experience,让模型参数与外围的智能体基础设施协同演化。
在攻读博士之前,我本科毕业于 Technical University of Denmark,曾受 Prof. Dim P. Papadopoulos 指导。本科期间,我也与 Dr. Gen Luo 和 Prof. Rongrong Ji 合作开展高效深度学习相关研究。这些经历让我持续关注高效、可扩展,并且能够服务真实世界任务的智能系统。
我的研究兴趣主要集中在:
- 多模态输入—多模态输出智能体系统:我关注能够理解异构多模态输入并生成多模态输出的智能体系统,在统一框架中整合理解、生成、推理、规划与行动。我尤其关注能够支持长程交互以及结构化、可编辑内容生成的原生多模态基础模型。
- 递归式自我改进智能体系统:我关注能够从 rollout trajectories 和 accumulated experience 中递归改进的智能体系统。在这类系统中,模型参数与外围的智能体基础设施——包括 harnesses、tools、memory、orchestration、evaluation 和 feedback loops——共同作为优化目标并协同演化,而不是将模型或其 scaffold 中的任何一方视为固定不变。
最近,我主要关注面向长程交互任务的多模态智能体基础模型与系统,尤其是 Agentic Design、Recursive Self-improvement Agentic Systems 和 Infrastructure Frameworks。
经历

Research Intern, Meituan LongCat Team
参与 Unified Multimodal Foundation Model Projects (LongCat-Next Team)。
- 面向统一多模态模型的长程多模态交互任务:Agentic Design System。
- 面向理解与生成统一建模的离散视觉编码器。

Research Assistant, MBZUAI
在 VILA Lab 由 Prof. Zhiqiang Shen 指导。
- 研究 language-pretraining-induced bias 如何作为通用视觉任务的强先验,展示 LLM 先验向纯视觉学习迁移的可能性,该工作发表于 TMLR 2026。
- 探索多模态大语言模型(MLLMs)中的推理与智能体行为,主导 OpenCaptchaWorld benchmark(NeurIPS 2025)。
最新动态
[2026-02-10] Next-Gen CAPTCHAs 已上线 arXiv。这是一套利用认知差异构建可扩展、多样化 GUI-Agent 防御任务的框架。
[2025-09-18] OpenCaptchaWorld 被 NeurIPS 2025 接收。
代表论文
(* 表示共同一作)
完整且最新的论文列表请参考我的 Google Scholar 主页。




