Guoliang You

Postdoctoral Researcher · University of Pennsylvania

Guoliang You

My research studies multimodal AI, from vision-language foundation models to agents that reason and act. My current focus is multimodal AI for healthcare, including vision-language pretraining for 3D medical images, multimodal LLMs, and evidence-grounded clinical agents. This direction builds on my Ph.D. research in embodied and autonomous systems, where I studied multi-sensor perception, vision-language reasoning, planning, and reinforcement learning. I remain involved in collaborative work on embodied AI, including vision-language-action learning and language-guided robotics.

I received my Ph.D. in Computer Technology from the University of Science and Technology of China (USTC), where I worked in the LINKE Lab with Prof. Yanyong Zhang and Assoc. Prof. Jianmin Ji. I earned my B.E. in Applied Physics from Anhui University of Science and Technology.

Research

My current work has two primary directions in healthcare, alongside continuing collaborations in embodied AI:

  • Medical vision-language learning · 3D imaging, anatomy-grounded pretraining, clinical report generation
  • Clinical reasoning and agents · multimodal LLMs, diagnostic QA, traceable evidence, tool use and verification
  • Embodied AI collaborations · vision-language-action learning and language-guided robotics, building on earlier work in sensor fusion, planning and reinforcement learning; exploring applications in healthcare

Publications

Authors are listed in publication order; Guoliang You is in bold and * marks equal contribution. Preprints are identified separately from peer-reviewed publications.

Click an illustration to view the hand-drawn overview or the original paper figure.

Medical AI

Hand-drawn SCOPE research overview

Semantically Calibrated Evidence Composition for CT Vision-Language Learning

Guoliang You, Haifan Gong, Xiaomeng Chu

arXiv preprint, 2026 · Paper

Composes anatomy-indexed findings with whole-volume context and calibrates the evidence against a diagnostic summary.

Hand-drawn Spectrum research overview

Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining

Guoliang You, Haifan Gong, Xiaomeng Chu

arXiv preprint, 2026 · Paper

Learns lower-to-higher disease-burden relationships across patients without longitudinal pairs.

Hand-drawn OKA-CT research overview

Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge

Guoliang You, Hongming Li, Yuanwang Zhang, Yong Fan

arXiv preprint, 2026 · Paper

Links 3D visual features to clinically structured, organ-level report knowledge.

Hand-drawn CT report generation research overview

Anatomy-Grounded CT Report Generation Guided by Organ-Hierarchical Clinical Knowledge

Guoliang You, Hongming Li, Yuanwang Zhang, Yong Fan

Journal of Imaging Informatics in Medicine supplement; SIIM CAIMI, 2026 · Abstract

Uses organ-aware visual tokens and clinical knowledge to guide CT report generation.

Hand-drawn OCP-CT research overview

Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding

Guoliang You, Xiaomeng Chu

arXiv preprint, 2026 · Paper

Models radiological patterns conditioned on the organ in which they occur.

Hand-drawn ThyroidXAgent research overview

Auditable Agentic AI for Evidence-Grounded Thyroid Ultrasound Diagnosis and Reporting

Haifan Gong, Shiyu Chen, Bodong Wang, Yuqi Wang, Shijie Wang, Guoliang You, Xinyu Xiong, Haowei Wang, Mingzhi Mao, Dexing Kong, Qinghua Liu, Wei Lou, Fei Chen, Guanbin Li

Collaborative arXiv preprint, 2026 · Paper

Studies traceable evidence and multi-step reasoning for thyroid ultrasound diagnosis.

Agents and evaluation

Hand-drawn WebGameBench research overview

WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games

Wenyu Zhang*, Guoliang You*, Tianlun, Haotian Zhao, Tianshu Zhu, Haoran Wang, Xiaoxuan Tang, Mingyang Dai, Jingnan Gu, Daxiang Dong, Jianmin Wu

arXiv preprint, 2026 · Paper

Evaluates the delivered game through real browser interaction, beyond whether its code builds.

Embodied AI and autonomous systems

Hand-drawn RaCFormer research overview

RaCFormer: Towards High-Quality 3D Object Detection via Query-Based Radar-Camera Fusion

Xiaomeng Chu, Jiajun Deng, Guoliang You, Yifan Duan, Houqiang Li, Yanyong Zhang

CVPR, 2025 · Paper

Fuses radar and camera evidence through object queries for 3D detection.

Hand-drawn GraspCoT research overview

GraspCoT: Integrating Physical Property Reasoning for 6-DoF Grasping under Flexible Language Instructions

Xiaomeng Chu, Jiajun Deng, Guoliang You, Wei Liu, Xingchen Li, Jianmin Ji, Yanyong Zhang

ICCV, 2025 · Paper

Reasons about object properties to ground flexible language instructions in robotic grasps.

Hand-drawn VLMPlanner research overview

VLMPlanner: Integrating Visual Language Models with Motion Planning

Zhipeng Tang, Sha Zhang, Jiajun Deng, Chenjie Wang, Guoliang You, Yuting Huang, Xinrui Lin, Yanyong Zhang

ACM Multimedia, 2025 · Paper

Connects visual-language scene understanding with motion planning for autonomous driving.

Hand-drawn LFP research overview

LFP: Efficient and Accurate End-to-End Lane-Level Planning via Camera-LiDAR Fusion

Guoliang You, Xiaomeng Chu, Yifan Duan, Xingchen Li, Sha Zhang, Jianmin Ji, Yanyong Zhang

arXiv preprint, 2024 · Paper

Combines camera and LiDAR features for lane-level planning in autonomous driving.

Hand-drawn Perception Helps Planning research overview

Perception Helps Planning: Facilitating Multi-Stage Lane-Level Integration via Double-Edge Data Structures

Guoliang You, Xiaomeng Chu, Yifan Duan, Wenyu Zhang, Xingchen Li, Sha Zhang, Yao Li, Jianmin Ji, Yanyong Zhang

IEEE Robotics and Automation Letters, 2024 · Paper

Uses structured perception output to connect lane-level mapping and route planning.

Hand-drawn P3O research overview

P3O: Transferring Visual Representations for Reinforcement Learning via Prompting

Guoliang You, Xiaomeng Chu, Yifan Duan, Jie Peng, Jianmin Ji, Yu Zhang, Yanyong Zhang

ICME, 2023 · Paper

Transfers pretrained visual features into reinforcement learning through prompting.

Hand-drawn CalibWorkflow research overview

CalibWorkflow: A General MLLM-Guided Workflow for Centimeter-Level Cross-Sensor Calibration

Xingchen Li, Wuyang Zhang, Guoliang You, Xiaomeng Chu, Wenhao Yu, Yifan Duan, Yuxuan Xiao, Yanyong Zhang

ACM Multimedia, 2025 · Paper

Uses a multimodal LLM to guide a cross-sensor calibration workflow.

Hand-drawn RayFormer research overview

RayFormer: Improving Query-Based Multi-Camera 3D Object Detection via Ray-Centric Strategies

Xiaomeng Chu, Jiajun Deng, Guoliang You, Yifan Duan, Yao Li, Yanyong Zhang

ACM Multimedia, 2024 · Paper

Places and samples object queries along camera rays to reduce ambiguous features.

Hand-drawn CELLmap research overview

CELLmap: Enhancing LiDAR SLAM through Elastic and Lightweight Spherical Map Representation

Yifan Duan, Xinran Zhang, Yao Li, Guoliang You, Xiaomeng Chu, Jianmin Ji, Yanyong Zhang

ICRA, 2025 · Paper

Builds a compact spherical map representation for LiDAR localization and mapping.

Hand-drawn EdgeCalib research overview

EdgeCalib: Multi-Frame Weighted Edge Features for Automatic Targetless LiDAR-Camera Calibration

Xingchen Li, Yifan Duan, Beibei Wang, Haojie Ren, Guoliang You, Yu Sheng, Jianmin Ji, Yanyong Zhang

IEEE Robotics and Automation Letters, 2024 · Paper

Matches weighted edge features across frames to calibrate LiDAR and camera without a target.

Hand-drawn LiDAR calibration research overview

Rotation Initialization and Stepwise Refinement for Universal LiDAR Calibration

Yifan Duan, Xinran Zhang, Guoliang You, Yilong Wu, Xingchen Li, Yao Li, Xiaomeng Chu, Jie Peng, Yu Zhang, Jianmin Ji, Yanyong Zhang

arXiv preprint, 2024 · Paper

Initializes multi-LiDAR rotation with a spherical descriptor, then refines extrinsic calibration.

Hand-drawn ElectricSight research overview

ElectricSight: 3D Hazard Monitoring for Power Lines Using Low-Cost Sensors

Xingchen Li, Lidian Wang, Yu Sheng, Zhipeng Tang, Haojie Ren, Guoliang You, Yifan Duan, Jianmin Ji, Yanyong Zhang

arXiv preprint, 2025 · Paper

Combines image-based hazard detection with 3D scene priors to estimate power-line clearance.

Experience

University of PennsylvaniaPostdoctoral Researcher · Philadelphia, PA
LimX DynamicsResearch Intern, multimodal foundation models and vision-language-action learning · Beijing
University of Science and Technology of China (USTC)Ph.D. in Computer Technology, LINKE Lab · HefeiAdvisors: Prof. Yanyong Zhang and Assoc. Prof. Jianmin Ji
AI Research Institute, Hefei Comprehensive National Science CenterResearch Intern, reinforcement learning and sim-to-real autonomous driving · Hefei
Anhui University of Science and TechnologyBachelor's degree in Applied Physics · Huainan

Beyond papers

Some of the most memorable parts of my research happened away from a desk: building platforms, testing them outside, and learning what changes when a model meets a physical system. These photos are from that part of my journey.

Guoliang with an early autonomous vehicle research platform
First-generation autonomous vehicle platform
Second-generation autonomous vehicle with upgraded sensors
Second-generation platform with upgraded sensors
Outdoor autonomous vehicle test with researchers
Autonomous vehicle testing outdoors
Single-arm robotic platform in a research workspace
Single-arm robotic platform
Dual-arm robot in a research workspace
Dual-arm robotic platform
Drone carrying a robotic arm for grasping research
Drone-robotic arm grasping platform

Research illustrations