StepAudio 3 Realtime Technical Report

📅 2026-09-12
📈 Citations: 0
✨ Influential: 0
📄 PDF
🤖 AI Summary
为实现实时口语互动,StepAudio 3 Realtime通过连续听-说-思-行循环模型,结合深度感知和无缝双工技术,并采用边说边思考的方法,有效解决了深入推理与低延迟之间的矛盾。
📝 Abstract
Realtime spoken interaction demands deep reasoning, prompt responses, and fluid turn-taking. We present StepAudio 3 Realtime, an audio-language foundation model organized around a continuous listen-converse-think-act loop. Deep Perception captures rich acoustic cues to interpret user intent, while Seamless Duplex models synchronized audio streams to handle pauses, backchannels, and interruptions naturally. Crucially, we resolve the tension between deep deliberation and latency via Think-While-Speaking, executing private reasoning in parallel with spoken delivery. In reasoning mode, StepAudio 3 reaches a 73.0 macro average on StepAudioChat. With Think-While-Speaking, it achieves dialogue and reasoning performance comparable to dedicated reasoning models while speaking in real time. Furthermore, an integrated Voice Agent handles asynchronous tool execution without disrupting the dialogue flow. StepAudio 3 Realtime achieves top-tier performance across key dimensions: an exceptional 90.6 on the MMSU benchmark, 98.9 Overall on the Artificial Analysis Full-Duplex Bench, and a 56.0% macro task-success rate on $τ$-Voice.
Problem

Research questions and friction points this paper is trying to address.

Realtime Spoken Interaction
Deep Reasoning
Latency
Turn-taking
Seamless Duplex
Innovation

Methods, ideas, or system contributions that make the work stand out.

Continuous Listen-Converse-Think-Act Loop
Deep Perception
Seamless Duplex
Think-While-Speaking
Integrated Voice Agent
🔎 Similar Papers
No similar papers found.
💼 Related Jobs
No related jobs found.
B
Bin Lin
B
Bo Zhao
B
Boyang Zhang
B
Boyong Wu
Chao Yan
Chao Yan
Instructor at DBMI, VUMC; CS PhD from Vanderbilt U
AI for medicineSynthetic health dataPrivacyFairness
Chen Geng
Chen Geng
Stanford University
4D VisionComputer GraphicsInverse Graphics
C
Chen Wu
C
Cheng Yi
C
Chengli Feng
C
Chenglin Zhu
C
Chengting Feng
Chengyuan Yao
Chengyuan Yao
Columbia University
Educational Data ScienceTransfer LearningAlgorithmic fairness
D
Daijiao Liu
D
DanNi Wan
Daxin Jiang
Daxin Jiang
Co-Founder & CEO, StepFun Corporation
Deep LearningFoundation Models
D
Dongjian Li
D
Dongqing Pang
F
Fei Tian
F
Feng Tian
F
Future Li
G
Gang Yu
G
Guanglong Yang
Haoyang Zhang
Haoyang Zhang
Ph.D. student of Computer Science, University of Illinois Urbana-Champaign
Computer ArchitectureSystem Software
H
Hongyuan Wang
J
Jia Peng