Publications

28 published, 4 preprints, 9 submitted

Exact venue strings. Submissions say so. Each page carries the figure and my part in the work.

Audio and speech

Vision, evaluation and agents

Figure: VERIFY: A Benchmark of Visual Reasoning for Multimodal Reasoning Fidelityaccepted

VERIFY: A Benchmark of Visual Reasoning for Multimodal Reasoning Fidelity

COLM 2026

Figure: MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

NeurIPS 2025

Figure: EAGLE: Egocentric Aggregated Language-video Engine

EAGLE: Egocentric Aggregated Language-video Engine

ACM MM 2024

Figure: OSCaR: Object State Captioning and State Change Representation

OSCaR: Object State Captioning and State Change Representation

Findings of NAACL 2024

Figure: Cross Modality Bias in Visual Question Answering: A Causal View with Possible Worlds VQA

Cross Modality Bias in Visual Question Answering: A Causal View with Possible Worlds VQA

IEEE Transactions on Multimedia 2024

Figure: BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blenderpreprint

BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender

arXiv 2026

Figure: What Language Model Agents Need to Reason Causally over Multivariate Time-Series Signalssubmission

What Language Model Agents Need to Reason Causally over Multivariate Time-Series Signals

Submitted to ICASSP 2027

Figure: I^2: Generating Instructional Illustrations via Text-Conditioned Diffusion

I^2: Generating Instructional Illustrations via Text-Conditioned Diffusion

IEEE/CVF CVPR 2026 Workshop Proceedings (AISTORY), CVPRW 2026

Front cover of Digital Discovery, volume 5 issue 5 (May 2026), featuring OPENXRD

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

Digital Discovery 2026, 5, 1991-2015 ยท Front cover, volume 5, issue 5 (May 2026)

Figure: Video Understanding with Large Language Models: A Survey

Video Understanding with Large Language Models: A Survey

IEEE TCSVT 36(2), 2026

Figure: Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting

Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting

AAAI Demonstration Track 2026, Best Demonstration Award Runner-up

Figure: Diagnosing visual reasoning: Challenges, insights, and a path forwardpreprint

Diagnosing visual reasoning: Challenges, insights, and a path forward

arXiv 2025

Figure: Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Modelspreprint

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

arXiv preprint 2025

Figure 1 of the survey: quarterly count of visual-reasoning paperspreprint

Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning

arXiv 2025

Figure: MISAR: A Multimodal Instructional System with Augmented Reality

MISAR: A Multimodal Instructional System with Augmented Reality

ICCV 2023 AV4D Workshop

Medical diagnosis automation and neural signals

Figure: Multi-agent Planning and Generation of Radiology Reports using Multimodal Agentic Frameworks

Multi-agent Planning and Generation of Radiology Reports using Multimodal Agentic Frameworks

SPIE Emerging Topics in Artificial Intelligence 2026 (presented 26 Aug 2026)

Figure: Inferring causal relations from multivariate data using Large-Scale Augmented Granger Causality (lsAGC)

Inferring causal relations from multivariate data using Large-Scale Augmented Granger Causality (lsAGC)

NeuroImage 2025

Figure: Large-scale extended Granger causality (lsXGC) for inferring directed dependence in large networks from short multivariate time-series datasubmission

Large-scale extended Granger causality (lsXGC) for inferring directed dependence in large networks from short multivariate time-series data

Submitted to Scientific Reports

Figure: Large-Scale Augmented Granger Causality for ADHD-Related Resting-State fMRI Dysconnectivitysubmission

Large-Scale Augmented Granger Causality for ADHD-Related Resting-State fMRI Dysconnectivity

Submitted to SPIE Medical Imaging 2027

Figure: Prior-Guided Sparse Large-Scale Granger Causality for ADHD-Related Resting-State fMRI Dysconnectivitysubmission

Prior-Guided Sparse Large-Scale Granger Causality for ADHD-Related Resting-State fMRI Dysconnectivity

Submitted to SPIE Medical Imaging 2027

Figure: Detecting Developmental Age-Group Signals in Naturalistic fMRI Using Large-Scale Augmented Granger Causalitysubmission

Detecting Developmental Age-Group Signals in Naturalistic fMRI Using Large-Scale Augmented Granger Causality

Submitted to SPIE Medical Imaging 2027

Figure: Efficient State-Space Modeling with Mamba for CT-Based Brain-Death Classification versus Transformer Baselinessubmission

Efficient State-Space Modeling with Mamba for CT-Based Brain-Death Classification versus Transformer Baselines

Submitted to SPIE Medical Imaging 2027

Figure: overview of the CLAIR multimodal prognostication framework (from the MIT-licensed project repository)

Multimodal Contrastive Prognostication Framework for Early Neurological Outcome Prediction in Post-Cardiac Arrest Patients

Scientific Reports 2026

Schematic: a diagnostic model reports a confidence band and flags unseen inputs

Uncertainty Quantification and Out-of-Distribution Detection in Skin and Breast Lesion Diagnostics Using Conformal Prediction

Emerging Topics in Artificial Intelligence (ETAI) 2025

Schematic: a directed brain-region graph feeds an attention model that classifies

Graph Attention Transformers and Large-Scale Granger Causality to Classify Marijuana Consumption from Functional MR Images

SPIE Medical Imaging 2024: Clinical and Biomedical Imaging

Schematic: report and image aligned globally and locally

Cross Modal Global Local Representation Learning from Radiology Reports and X-Ray Chest Images

SPIE Medical Imaging 2023: Computer-Aided Diagnosis

Schematic: many hospitals feed one nationwide record over time

Early-stage COVID-19 Pandemic Observations on Pulmonary Embolism Using Nationwide Multi-Institutional Data Harvesting

npj Digital Medicine 2022

Figure: Relation Discovery in Nonlinearly Related Large-Scale Settings

Relation Discovery in Nonlinearly Related Large-Scale Settings

ICASSP 2022

Figure: Leveraging Pre-Images to Discover Nonlinear Relationships in Multivariate Environments

Leveraging Pre-Images to Discover Nonlinear Relationships in Multivariate Environments

EUSIPCO 2021

Figure: Large-scale Nonlinear Granger Causality for Inferring Directed Dependence from Short Multivariate Time-Series Data

Large-scale Nonlinear Granger Causality for Inferring Directed Dependence from Short Multivariate Time-Series Data

Scientific Reports 2021

Electronic design automation and hardware accelerators