Scholar
Gouthaman KV
Google Scholar ID: Bj1k2rUAAAAJ
Senior Researcher @ Dolby Laboratories, PhD@ CSE, IIT Madras
Multimodal
Computer Vision
NLP
Music Generation
AI Codec
Follow
Google Scholar
↗
Citations & Impact
All-time
Citations
129
H-index
4
i10-index
2
Publications
10
Co-authors
9
list available
Publications
9 items
Multichannel Audio Quality Assessment: Extending Pretrained Perceptual Models to Spatial Audio
2026
Cited
0
Audible World Models: Spatially Aware Sound Generation for 3D Worlds
2026
Cited
0
Spot, Separate, and Enhance: Fully Generative Approach for Audio Mixing
2026
Cited
0
VIBE: Video Instruction-aligned Background music gEneration
2026
Cited
0
A robust PPG foundation model using multimodal physiological supervision
2026
Cited
0
Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation
2026
Cited
0
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
2025
Cited
0
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
2025
Cited
0
Load more
Co-authors
8 total
Anurag Mittal
Professor of Computer Science and Engg., IIT Madras, INDIA
Athira Nambiar
Research Associate Professor, Dept. of Computational Intelligence, SRMIST, Chennai
Andrea Fanelli
Principal Researcher at Dolby Laboratories
Lie Lu
Dolby Laboratories
Subhransu Maji
Professor, University of Massachusetts, Amherst
Grant Van Horn
UMass, Amherst
Mustafa Chasmai
University of Massachusetts, Amherst
Gauri Jagatap
Senior Researcher, Dolby Laboratories