fix(voice): suppress low-signal turns and false lookup replies
This commit is contained in:
@@ -1451,6 +1451,52 @@ def test_voice_v2_streaming_duplex_early_plan_returns_fast_safe_reply_without_ll
|
||||
assert "оператор" in decision["reply_text"].lower()
|
||||
|
||||
|
||||
def test_voice_decision_hearing_check_keeps_active_topic_without_llm(monkeypatch):
|
||||
def _unexpected_llm(messages):
|
||||
raise AssertionError(f"LLM should not be called for hearing check: {messages!r}")
|
||||
|
||||
monkeypatch.setattr(ai_module, "_request_structured_model_decision", _unexpected_llm)
|
||||
|
||||
decision = voice_module._voice_decision(
|
||||
language="ru",
|
||||
customer=None,
|
||||
interaction=SimpleNamespace(interaction_id="int_voice_hearing", status="new", queue_id="que_voice", subject="schedule"),
|
||||
transcript_text="Алло, ты меня слышишь?",
|
||||
transcript_window=[
|
||||
SimpleNamespace(speaker="caller", text="Мне надо узнать график работы.", sequence_no=1, source_type="voice_asr", barge_in_interrupted=False, created_at=utc_now_iso()),
|
||||
SimpleNamespace(speaker="assistant", text="Подскажите, какой именно график работы вас интересует?", sequence_no=2, source_type="voice_policy", barge_in_interrupted=False, created_at=utc_now_iso()),
|
||||
SimpleNamespace(speaker="caller", text="В городе Алмата.", sequence_no=3, source_type="voice_asr", barge_in_interrupted=False, created_at=utc_now_iso()),
|
||||
SimpleNamespace(speaker="caller", text="Алло, ты меня слышишь?", sequence_no=4, source_type="voice_asr", barge_in_interrupted=False, created_at=utc_now_iso()),
|
||||
],
|
||||
kb_results=[],
|
||||
disclosure_required=False,
|
||||
request_metadata={"voice_v2_enabled": True, "response_plan_id": "rsp_hearing"},
|
||||
)
|
||||
|
||||
assert decision["model"] == "voice_policy_hearing_check"
|
||||
assert decision["reply_text"].startswith("Да, вас слышу.")
|
||||
assert "Как я могу помочь" not in decision["reply_text"]
|
||||
assert "филиал" in decision["reply_text"] or "адрес" in decision["reply_text"]
|
||||
|
||||
|
||||
def test_voice_postprocess_reply_rewrites_false_lookup_promise():
|
||||
reply_text = voice_module._voice_postprocess_reply_text(
|
||||
language="ru",
|
||||
transcript_text="В городе Алмата.",
|
||||
transcript_window=[
|
||||
SimpleNamespace(speaker="caller", text="Мне надо узнать график работы.", sequence_no=1, source_type="voice_asr", barge_in_interrupted=False, created_at=utc_now_iso()),
|
||||
SimpleNamespace(speaker="caller", text="В городе Алмата.", sequence_no=2, source_type="voice_asr", barge_in_interrupted=False, created_at=utc_now_iso()),
|
||||
],
|
||||
reply_text="Спасибо. Я уточню график работы в Алмате. Минуточку, пожалуйста.",
|
||||
kb_results=[],
|
||||
needs_handoff=False,
|
||||
)
|
||||
|
||||
assert "уточню" not in reply_text.lower()
|
||||
assert "минуточ" not in reply_text.lower()
|
||||
assert "филиал" in reply_text.lower() or "адрес" in reply_text.lower()
|
||||
|
||||
|
||||
def test_turn_voice_session_early_plan_does_not_persist_partial_turns(monkeypatch):
|
||||
monkeypatch.setenv("AI_VOICE_POLICY_MODE", "v2_streaming_duplex")
|
||||
|
||||
|
||||
@@ -842,7 +842,7 @@ def test_media_runtime_voice_v2_emits_generic_ack_before_full_asr_without_partia
|
||||
frame_ms=20,
|
||||
frame_bytes=320,
|
||||
)
|
||||
await runtime._process_utterance(actor, pcm_frame * 30, False)
|
||||
await runtime._process_utterance(actor, pcm_frame * 45, False)
|
||||
|
||||
asyncio.run(_scenario())
|
||||
|
||||
@@ -940,7 +940,7 @@ def test_media_runtime_voice_v2_emits_ack_for_short_utterance_after_reduced_thre
|
||||
frame_ms=20,
|
||||
frame_bytes=320,
|
||||
)
|
||||
await runtime._process_utterance(actor, pcm_frame * 20, False)
|
||||
await runtime._process_utterance(actor, pcm_frame * 40, False)
|
||||
|
||||
asyncio.run(_scenario())
|
||||
|
||||
@@ -949,6 +949,92 @@ def test_media_runtime_voice_v2_emits_ack_for_short_utterance_after_reduced_thre
|
||||
assert speak_events[0][1] < timings["full_finished"]
|
||||
|
||||
|
||||
def test_media_runtime_ignores_low_signal_utterance_without_ack_or_turn():
|
||||
planned: list[tuple[str, str, str, dict | None]] = []
|
||||
delivered: list[tuple[str, str, bool]] = []
|
||||
turns: list[str] = []
|
||||
|
||||
class _LowSignalASRProvider(ASRProvider):
|
||||
name = "low-signal-asr"
|
||||
|
||||
def transcribe(self, audio_bytes: bytes, *, language_hint: str | None = None) -> ASRTranscription:
|
||||
assert audio_bytes
|
||||
return ASRTranscription(text="Ой", language=language_hint or "ru", confidence=0.82)
|
||||
|
||||
runtime = AudioSocketMediaRuntime(
|
||||
enabled=True,
|
||||
host="127.0.0.1",
|
||||
port=0,
|
||||
frame_ms=20,
|
||||
idle_timeout_seconds=2.0,
|
||||
registration_wait_timeout_seconds=0.5,
|
||||
min_speech_ms=40,
|
||||
trailing_silence_ms=40,
|
||||
max_turn_ms=2000,
|
||||
asr_provider=_LowSignalASRProvider(),
|
||||
tts_provider=_StubTTSProvider(),
|
||||
load_registration_by_media_uuid=lambda value: None,
|
||||
mark_media_connected=lambda session_id, value: None,
|
||||
mark_media_ended=lambda session_id, reason: None,
|
||||
touch_media_frame=lambda session_id: None,
|
||||
set_state=lambda session_id, state, handoff_reason, metadata: None,
|
||||
get_pending_greeting=lambda session_id: None,
|
||||
mark_reply_delivered=lambda session_id, text, is_greeting: delivered.append((session_id, text, is_greeting)),
|
||||
plan_reply=lambda session_id, text, metadata, kind: planned.append((session_id, text, kind, metadata)),
|
||||
process_turn=lambda session_id, transcript_text, language, barge_in, metadata: (
|
||||
turns.append(transcript_text)
|
||||
or VoiceAITurnDecisionOut(
|
||||
language=language or "ru",
|
||||
intent="clarification",
|
||||
reply_text="Подскажите подробнее.",
|
||||
confidence=0.9,
|
||||
needs_handoff=False,
|
||||
handoff_reason=None,
|
||||
case_action="keep_open",
|
||||
kb_refs=[],
|
||||
summary_text="reply ready",
|
||||
model="stub-voice",
|
||||
latency_ms=1,
|
||||
status="active",
|
||||
)
|
||||
),
|
||||
request_handoff=lambda session_id, customer_request_text, decision: None,
|
||||
handle_media_error=lambda session_id, message, metadata: None,
|
||||
)
|
||||
|
||||
async def _scenario() -> None:
|
||||
actor = MediaActor(
|
||||
registration=MediaRegistration(
|
||||
voice_session_id="avs_media_runtime_low_signal",
|
||||
call_id="call_media_runtime_low_signal",
|
||||
interaction_id="int_media_runtime_low_signal",
|
||||
ai_session_id="ais_media_runtime_low_signal",
|
||||
language="ru",
|
||||
media_uuid=str(uuid.uuid4()),
|
||||
queue_code="voice_lab_ai",
|
||||
queue_id="que_voice_lab_ai",
|
||||
agent_profile="voice_support",
|
||||
voice_v2_enabled=True,
|
||||
voice_v2_ack_mode="immediate_short",
|
||||
voice_v2_streaming_tts=True,
|
||||
voice_v2_partial_asr=False,
|
||||
),
|
||||
reader=asyncio.StreamReader(),
|
||||
writer=None, # type: ignore[arg-type]
|
||||
vad=EnergyVAD(frame_ms=20, min_speech_ms=40, trailing_silence_ms=40, max_turn_ms=2000),
|
||||
frame_ms=20,
|
||||
frame_bytes=320,
|
||||
)
|
||||
pcm_frame = (1000).to_bytes(2, "little", signed=True) * 160
|
||||
await runtime._process_utterance(actor, pcm_frame * 12, False)
|
||||
|
||||
asyncio.run(_scenario())
|
||||
|
||||
assert turns == []
|
||||
assert planned == []
|
||||
assert delivered == []
|
||||
|
||||
|
||||
def test_media_runtime_voice_v2_inserts_small_gap_between_ack_and_main_reply():
|
||||
speak_events: list[tuple[str, float]] = []
|
||||
|
||||
|
||||
Reference in New Issue
Block a user