个人简介

  • 计算机视觉
  • 视觉与语言
  • 具身智能

本人研究方向为计算机视觉、自然语言与机器人的交叉领域,近期主要聚焦于具身智能,致力于让机器人能够理解人类指令、感知并推理三维环境,并在真实物理世界中可靠地完成任务。目前的研究主要包括:

  • 机器人操作:语言引导的机械臂操作,以及机器狗搭载机械臂的移动操作。
  • 人机交互:交互式视觉定位,通过对话消解人类指令中的歧义。
  • 多模态感知:三维视觉定位(3D Visual Grounding)与三维可供性(3D Affordance)理解,面向可执行的场景感知。

此前从事语言驱动的视频理解、开放词汇图像/视频识别,以及手部检测、手部姿态估计、人脸识别与行人重识别等研究。

🎓 欢迎对具身智能、视觉与语言等方向感兴趣的同学加入课题组!

学术动态

论文

Google Scholar 引用 * 共同一作  ·  † 通讯作者
  1. AmbiRefer3D: 3D Visual Grounding with Referential Ambiguity

    Rongjiang Zhu*, Wei Kang*, Zeqi Liu, Junyu Chen, Shuo Yang†, Xinxiao Wu†

    International Conference on Machine Learning (ICML), 2026

    
      
  2. Image-free Multi-label Image Recognition via LLM-powered Hierarchical Prompt Tuning

    Shuo Yang†, Zirui Shang, Yongqi Wang, Derong Deng, Hongwei Chen, Xinxiao Wu, Qiyuan Cheng

    Pattern Recognition (PR), 2026

    
      
  3. LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching

    Mengxiao Tian, Xinxiao Wu, Shuo Yang†

    International Conference on Computer Vision (ICCV), 2025

    
      
  4. METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection

    Yongqi Wang, Xinxiao Wu, Shuo Yang†

    International Joint Conference on Artificial Intelligence (IJCAI), 2025

  5. End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting

    Yongqi Wang, Xinxiao Wu, Shuo Yang, Jiebo Luo

    IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025

    
      

教育背景

  • 2018.09 - 2024.06
    计算机科学与技术博士,北京理工大学计算机学院
    导师:王树良(2018.09 - 2021.06),2021.06 起师从 吴心筱。
  • 2014.09 - 2017.07
    计算机科学与技术硕士,中国科学院软件研究所
    导师:邓小明。
  • 2010.09 - 2014.07
    计算机科学与技术学士,北京联合大学信息学院。

工作经历