Revert "feat(voice): start early replies before final asr"

This reverts commit a44a1b97a1.
This commit is contained in:
Yera All
2026-04-19 01:30:26 +05:00
parent 224973d840
commit aa64b6b94c
2 changed files with 100 additions and 469 deletions
-136
View File
@@ -1981,142 +1981,6 @@ def test_media_runtime_voice_v2_uses_early_plan_before_slow_final_decision():
assert events.index(("main", "early reply")) < events.index("final_done")
def test_media_runtime_voice_v2_starts_early_main_before_slow_final_asr():
events: list[str | tuple[str, str]] = []
class _SlowStreamingProvider(StreamingASRProvider):
name = "slow-streaming"
supports_streaming = True
def finalize(self, stream_id: str) -> ASRTranscription:
assert stream_id == "stream-1"
events.append("finalize_start")
time.sleep(0.35)
events.append("finalize_done")
return ASRTranscription(text="work schedule", language="ru", confidence=0.9)
def close_stream(self, stream_id: str) -> None:
assert stream_id == "stream-1"
def _process_turn(session_id, transcript_text, language, barge_in, metadata):
del session_id, transcript_text, barge_in
if metadata and metadata.get("reply_phase") == "early_plan":
events.append("early_plan")
return VoiceAITurnDecisionOut(
language=language or "ru",
intent="schedule",
reply_text="early reply",
confidence=0.8,
needs_handoff=False,
handoff_reason=None,
case_action="keep_open",
kb_refs=[],
summary_text="early ready",
model="early",
latency_ms=1,
status="active",
)
events.append("final_turn")
return VoiceAITurnDecisionOut(
language=language or "ru",
intent="schedule",
reply_text="final reply",
confidence=0.9,
needs_handoff=False,
handoff_reason=None,
case_action="keep_open",
kb_refs=[],
summary_text="final ready",
model="final",
latency_ms=1,
status="active",
)
runtime = AudioSocketMediaRuntime(
enabled=True,
host="127.0.0.1",
port=0,
frame_ms=20,
idle_timeout_seconds=2.0,
registration_wait_timeout_seconds=0.5,
min_speech_ms=40,
trailing_silence_ms=40,
max_turn_ms=2000,
asr_provider=_StubASRProvider(),
streaming_asr_provider=_SlowStreamingProvider(),
tts_provider=_StubTTSProvider(),
load_registration_by_media_uuid=lambda value: None,
mark_media_connected=lambda session_id, value: None,
mark_media_ended=lambda session_id, reason: None,
touch_media_frame=lambda session_id: None,
set_state=lambda session_id, state, handoff_reason, metadata: None,
get_pending_greeting=lambda session_id: None,
mark_reply_delivered=lambda session_id, text, is_greeting: None,
plan_reply=lambda session_id, text, metadata, kind: None,
process_turn=_process_turn,
request_handoff=lambda session_id, customer_request_text, decision: None,
handle_media_error=lambda session_id, message, metadata: None,
)
async def _fake_speak_reply(
actor: MediaActor,
text: str,
*,
is_greeting: bool,
style_hints: dict[str, object] | None = None,
reply_phase: str | None = "main",
) -> None:
del actor, is_greeting, style_hints
events.append((str(reply_phase), text))
runtime._speak_reply = _fake_speak_reply # type: ignore[method-assign]
async def _scenario() -> None:
actor = MediaActor(
registration=MediaRegistration(
voice_session_id="avs_media_runtime_early_before_final_asr",
call_id="call_media_runtime_early_before_final_asr",
interaction_id="int_media_runtime_early_before_final_asr",
ai_session_id="ais_media_runtime_early_before_final_asr",
language="ru",
media_uuid=str(uuid.uuid4()),
queue_code="voice_lab_ai",
queue_id="que_voice_lab_ai",
agent_profile="voice_support",
voice_v2_enabled=True,
voice_v2_ack_mode="immediate_short",
voice_v2_streaming_tts=True,
voice_v2_partial_asr=True,
voice_v2_duplex=True,
voice_v2_streaming_asr_backend="local_sidecar",
),
reader=asyncio.StreamReader(),
writer=None, # type: ignore[arg-type]
vad=EnergyVAD(frame_ms=20, min_speech_ms=40, trailing_silence_ms=40, max_turn_ms=2000),
frame_ms=20,
frame_bytes=320,
)
actor.asr_streaming_enabled = True
actor.asr_stream_id = "stream-1"
actor.partial_transcript = "work schedule"
actor.stable_partial_transcript = "work schedule"
actor.partial_intent = "schedule"
actor.stable_partial_intent = "schedule"
pcm_frame = (1000).to_bytes(2, "little", signed=True) * 160
await runtime._process_utterance(actor, pcm_frame * 40, False)
for _ in range(80):
if "final_turn" in events:
break
await asyncio.sleep(0.01)
asyncio.run(_scenario())
assert "finalize_start" in events
assert ("main", "early reply") in events
assert events.index(("main", "early reply")) < events.index("finalize_done")
assert ("main", "final reply") not in events
def test_media_runtime_voice_v2_uses_partial_as_final_when_streaming_finalize_fails():
captured: list[tuple[str, dict | None]] = []