feat(voice): emit immediate ack on turn close

This commit is contained in:
Yera All
2026-04-11 01:40:04 +05:00
parent c39fad7e2d
commit 6413beeba1
2 changed files with 165 additions and 50 deletions
+92
View File
@@ -722,3 +722,95 @@ def test_media_runtime_voice_v2_uses_partial_asr_to_start_ack_before_full_asr():
assert speak_events
assert speak_events[0][0] == runtime._ack_text("ru", "understanding")
assert speak_events[0][1] < timings["full_finished"]
def test_media_runtime_voice_v2_emits_generic_ack_before_full_asr_without_partial_signal():
timings: dict[str, float] = {}
speak_events: list[tuple[str, float]] = []
class _SlowOnlyASRProvider(ASRProvider):
name = "slow-only-asr"
def transcribe(self, audio_bytes: bytes, *, language_hint: str | None = None) -> ASRTranscription:
assert audio_bytes
timings["full_started"] = time.monotonic()
time.sleep(0.35)
timings["full_finished"] = time.monotonic()
return ASRTranscription(text="hello there", language=language_hint or "ru", confidence=0.9)
runtime = AudioSocketMediaRuntime(
enabled=True,
host="127.0.0.1",
port=0,
frame_ms=20,
idle_timeout_seconds=2.0,
registration_wait_timeout_seconds=0.5,
min_speech_ms=40,
trailing_silence_ms=40,
max_turn_ms=2000,
asr_provider=_SlowOnlyASRProvider(),
tts_provider=_StubTTSProvider(),
load_registration_by_media_uuid=lambda value: None,
mark_media_connected=lambda session_id, value: None,
mark_media_ended=lambda session_id, reason: None,
touch_media_frame=lambda session_id: None,
set_state=lambda session_id, state, handoff_reason, metadata: None,
get_pending_greeting=lambda session_id: None,
mark_reply_delivered=lambda session_id, text, is_greeting: None,
plan_reply=lambda session_id, text, metadata, kind: None,
process_turn=lambda session_id, transcript_text, language, barge_in, metadata: VoiceAITurnDecisionOut(
language=language or "ru",
intent="clarification",
reply_text="Подскажите подробнее, пожалуйста.",
confidence=0.9,
needs_handoff=False,
handoff_reason=None,
case_action="keep_open",
kb_refs=[],
summary_text="reply ready",
model="stub-voice",
latency_ms=1,
status="active",
),
request_handoff=lambda session_id, customer_request_text, decision: None,
handle_media_error=lambda session_id, message, metadata: None,
)
async def _fake_speak_text(current_actor, text: str, *, is_greeting: bool) -> None:
del current_actor, is_greeting
speak_events.append((text, time.monotonic()))
await asyncio.sleep(0)
runtime._speak_text = _fake_speak_text # type: ignore[method-assign]
pcm_frame = (1000).to_bytes(2, "little", signed=True) * 160
async def _scenario() -> None:
actor = MediaActor(
registration=MediaRegistration(
voice_session_id="avs_media_runtime_v2_generic_ack",
call_id="call_media_runtime_v2_generic_ack",
interaction_id="int_media_runtime_v2_generic_ack",
ai_session_id="ais_media_runtime_v2_generic_ack",
language="ru",
media_uuid=str(uuid.uuid4()),
queue_code="voice_lab_ai",
queue_id="que_voice_lab_ai",
agent_profile="voice_support",
voice_v2_enabled=True,
voice_v2_ack_mode="immediate_short",
voice_v2_streaming_tts=True,
voice_v2_partial_asr=False,
),
reader=asyncio.StreamReader(),
writer=None, # type: ignore[arg-type]
vad=EnergyVAD(frame_ms=20, min_speech_ms=40, trailing_silence_ms=40, max_turn_ms=2000),
frame_ms=20,
frame_bytes=320,
)
await runtime._process_utterance(actor, pcm_frame * 30, False)
asyncio.run(_scenario())
assert speak_events
assert speak_events[0][0] == runtime._ack_text("ru", "generic")
assert speak_events[0][1] < timings["full_finished"]