AcousticDiffusion: Semantically Conditioned Audio-Guided Diffusion Policy for Search-and-Rescue Assistance

📅 2026-09-18
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
研究通过AcousticDiffusion方法,利用音频引导和语义条件下的扩散策略解决搜救机器人在视觉受限环境中的导航问题,实现更准确地定位求助者。
📝 Abstract
Navigating toward human callers is an important capability for rescue robots operating where visual contact is degraded or occluded. We present AcousticDiffusion, a semantically conditioned, audio-guided diffusion policy for human-directed navigation. A frozen pretrained audio recognizer processes 10.24 s windows, with speech gating and distress-aware prioritization converting recognition outputs into source-level navigation roles. Microphone-array direction-of-arrival measurements are recursively integrated into a robot-centric Bayesian bird's-eye-view belief field. Ego-motion compensation aligns successive observations, progressively constraining source position while preserving bearing-induced range uncertainty. The semantic belief, recent acoustic observations, audio features, and robot state condition a diffusion model that generates waypoint trajectories. On a synthetic-navigation validation set using recorded audio, AcousticDiffusion achieves a mean end-point bearing error of 11.20 degrees, with 91.78% of trajectories aligned within 30 degrees of the caller. Distractor rejection ranges from 89.20% to 98.99%, and the policy favors a HELP-designated caller over a competing speaker in 91.07% of windows. Deployed online on a ZSL-1 quadruped without additional retraining, it achieves a mean bearing error of 64.9 degrees, compared with 98.2 degrees for A* and 90.4 degrees for RRT, with a mean planner compute time of 6.07 ms. Despite imperfect acoustic localization, the reported mean final source distance is reduced from 3.96 m for the classical planners using ODAS-derived (Open embedded Audition System) guidance to 2.48 m, a 37.4% improvement. These results demonstrate the framework's ability to translate uncertain acoustic observations into closer approaches to human callers.
Problem

Research questions and friction points this paper is trying to address.

audio-guided
navigation
rescue robots
human callers
acoustic localization
Innovation

Methods, ideas, or system contributions that make the work stand out.

AcousticDiffusion
audio-guided diffusion policy
Bayesian belief field
semantic conditioning
search-and-rescue
🔎 Similar Papers
No similar papers found.
I
Iana Zhura
Skolkovo Institute of Science and Technology, Moscow, Russia
D
Didar Seyidov
Skolkovo Institute of Science and Technology, Moscow, Russia
D
Dmitrii Plotnikov
Skolkovo Institute of Science and Technology, Moscow, Russia
H
Hajira Amjad
Skolkovo Institute of Science and Technology, Moscow, Russia
Miguel Altamirano Cabrera
Miguel Altamirano Cabrera
Research Scientist, Skolkovo Institute of Science and Technology
HapticsRoboticsTactile SensationComputer Vision
Dzmitry Tsetserukou
Dzmitry Tsetserukou
Associate Professor, Skolkovo Institute of Science and Technology (Skoltech)
RoboticsHapticsUAV SwarmAIVR