AD logoAnkan DeriaContact

About me

I’m an M.Sc. student in Computer Vision at MBZUAI, advised by Prof. Salman Khan. My research focuses on world models and long-horizon planning, video generation, vision-language models, and unified multimodal architectures.

Research

Selected research

WORLD MODELS Under review · ICLR 2027

WorldGuide

Goal-directed video world models for long-horizon procedural task execution.

Research details
VISION–LANGUAGE ACM MM 2026

CoME-VL

Scaling vision-language learning with complementary visual encoders.

Explore project
MEDICAL AI CVPR 2026

MedMO

Grounding and understanding medical images with multimodal language models.

Explore project

Publications

Publications

Google Scholar
12 publications

OmniSE: Support-Faithful Optimization for Evidence-Centric Audio-Video Reasoning

Xilin He, Yifan Shen, Ankan Deria, Xiangyu Yue, Muhammad Haris Khan

NeurIPS 2026
  • multimodal AI
  • audio-video reasoning
  • evidence grounding

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

  • vision-language models
  • multi-encoder learning

NeMoColor: Unified Noise Modulation for Enhanced Diffusion-based Image Colorization

Ankan Deria, Dwarikanath Mahapatra, Murari Mondal, Sudipta Roy

AAAI 2026
  • diffusion models
  • image colorization

ReferralSeg: A Multi-Cancer Benchmark for Clinician-Style Language-Guided Segmentation in Histopathology

Roba Al Majzoub, Ankan Deria, Numan Saeed, Salman Khan, Klaus Maier-Hein, Shadab Khan, Fahad Shahbaz Khan

MICCAI 2026 · COMPAYL Workshop
  • histopathology
  • language-guided segmentation
  • medical AI

ViMaR: Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning

Ankan Deria, Adinath Madhavrao Dukre, Feilong Tang, Sara Atito, Sudipta Roy, Muhammad Awais, Muhammad Haris Khan, Imran Razzak

NeurIPS 2025
  • vision-language models
  • inference-time reasoning
  • image captioning

Robust semantic learning for precise medical image segmentation

Snehashis Chakraborty, Komal Kumar, Ankan Deria, Dwarikanath Mahapatra, Behzad Bozorgtabar, Sudipta Roy

BSPC 2025
  • medical imaging
  • semantic learning
  • segmentation

InVERGe: Intelligent Visual Encoder for Bridging Modalities in Report Generation

Ankan Deria, Komal Kumar, Snehashis Chakraborty, Dwarikanath Mahapatra, Sudipta Roy

CVPRW 2024
  • medical imaging
  • visual encoders
  • report generation

WorldGuide: Goal-Directed Video World Model for Procedural Task Execution

Ankan Deria, Komal Kumar, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

ICLR 2027Under review
  • world models
  • video generation
  • long-horizon planning

Training-Free Speech-Centric Omni Understanding with Frozen VLMs

Ankan Deria, Hanoona Rasheed, Xilin He, Fahad Shahbaz Khan, Salman Khan

AAAI 2027Under review
  • speech understanding
  • multimodal AI
  • training-free inference

MuGa-VTON: Multi-Garment Virtual Try-On via Diffusion Transformers with Prompt Customization

Ankan Deria, Dwarikanath Mahapatra, Bozorgtabar Behzad, Mohna Chakraborty, Snehashis Chakraborty, Sudipta Roy

TMLR 2026Under review
  • virtual try-on
  • diffusion transformers
  • image generation

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

  • diffusion models
  • reward steering
  • safe generation

Experience & education

Education

2025 — EXPECTED 2027

M.Sc. in Computer Vision

Mohamed bin Zayed University of Artificial Intelligence

First-year GPA: 3.7 / 4.0
2020 — 2024

B.Tech. in Computer Science & Engineering

Government College of Engineering and Leather Technology

CGPA: 9.26 / 10

Research experience

AUG 2025 — PRESENT

M.Sc. Student · Computer Vision

MBZUAI Abu Dhabi, UAE

Advised by Prof. Salman Khan. Research on goal-directed world models, medical multimodal understanding, and complementary vision-language learning.

JUN 2025 — AUG 2025

Research Assistant

MBZUAI Abu Dhabi, UAE

Advised by Prof. Imran Razzak. Developed value-guided inference for fast, faithful vision-language captioning through ViMaR.

JUL 2024 — JUN 2025

Researcher

Jio Institute Navi Mumbai, India

Advised by Prof. Sudipta Roy. Worked on diffusion-based colorization, multi-garment virtual try-on, and medical image segmentation.

JUL 2023 — OCT 2023

Research Intern

Jio Institute Navi Mumbai, India

Advised by Prof. Sudipta Roy. Developed visual encoders for radiology report generation with InVERGe.

Academic service

Honors & Awards

Compute Transparency Champion

CVPR 2026 · MedMO

3rd place · Research Showcase

MBZUAI · 2025

Research community

Reviewer · NeurIPS, ICLR, WACV, BMVC

Open-source leadership

Led Omdena’s Kolkata chapter (December 2022–August 2023), contributing to NLP projects in text summarization, hate speech detection, and job recommendation.

Contact

Get in touch

For research discussions and collaborations, please contact me by email.