feat(voice): emit immediate ack on turn close
This commit is contained in:
@@ -135,6 +135,7 @@ class AudioSocketMediaRuntime:
|
||||
self._actors: dict[str, MediaActor] = {}
|
||||
self._v2_ack_wait_seconds = 0.18
|
||||
self._partial_asr_min_ms = 650
|
||||
self._immediate_ack_min_ms = 450
|
||||
|
||||
@staticmethod
|
||||
def _normalize_intent_text(text: str) -> str:
|
||||
@@ -188,6 +189,10 @@ class AudioSocketMediaRuntime:
|
||||
def _partial_asr_min_bytes(self) -> int:
|
||||
return self._partial_asr_min_ms * 16
|
||||
|
||||
@property
|
||||
def _immediate_ack_min_bytes(self) -> int:
|
||||
return self._immediate_ack_min_ms * 16
|
||||
|
||||
@staticmethod
|
||||
def _reset_live_turn_state(actor: MediaActor) -> None:
|
||||
actor.utterance_generation += 1
|
||||
@@ -268,6 +273,36 @@ class AudioSocketMediaRuntime:
|
||||
)
|
||||
)
|
||||
|
||||
async def _emit_early_ack(
|
||||
self,
|
||||
actor: MediaActor,
|
||||
*,
|
||||
language: str | None,
|
||||
metadata: dict[str, Any],
|
||||
ack_source: str,
|
||||
) -> None:
|
||||
if actor.closed or actor.early_ack_started:
|
||||
return
|
||||
ack_kind = self._ack_kind_for_intent(actor.partial_intent or "unknown")
|
||||
ack_text = self._ack_text(language or actor.registration.language, ack_kind)
|
||||
actor.early_ack_started = True
|
||||
await self._plan_reply_segment(
|
||||
actor,
|
||||
ack_text,
|
||||
kind="ack",
|
||||
metadata={
|
||||
**metadata,
|
||||
"partial_transcript": actor.partial_transcript,
|
||||
"early_intent": actor.partial_intent,
|
||||
"ack_kind": ack_kind,
|
||||
"phase": "ack",
|
||||
"partial_ack_source": ack_source,
|
||||
},
|
||||
)
|
||||
await self._speak_text(actor, ack_text, is_greeting=False)
|
||||
if not actor.closed:
|
||||
await self._set_actor_state(actor, "thinking")
|
||||
|
||||
async def _plan_reply_segment(
|
||||
self,
|
||||
actor: MediaActor,
|
||||
@@ -515,34 +550,39 @@ class AudioSocketMediaRuntime:
|
||||
)
|
||||
)
|
||||
)
|
||||
if self._should_use_voice_v2(actor.registration) and partial_transcript and not actor.early_ack_started:
|
||||
ack_kind = self._ack_kind_for_intent(partial_intent or "unknown")
|
||||
ack_text = self._ack_text(actor.registration.language, ack_kind)
|
||||
actor.early_ack_started = True
|
||||
base_metadata = {
|
||||
"turn_duration_ms": int(len(pcm_bytes) / 16),
|
||||
"media_uuid": actor.registration.media_uuid,
|
||||
"queue_code": actor.registration.queue_code,
|
||||
"voice_v2_enabled": actor.registration.voice_v2_enabled,
|
||||
"response_plan_id": actor.response_plan_id,
|
||||
"playback_generation": actor.playback_generation,
|
||||
"partial_transcript": partial_transcript,
|
||||
"early_intent": partial_intent,
|
||||
}
|
||||
await self._plan_reply_segment(
|
||||
actor,
|
||||
ack_text,
|
||||
kind="ack",
|
||||
metadata={
|
||||
**base_metadata,
|
||||
"ack_kind": ack_kind,
|
||||
"phase": "ack",
|
||||
"partial_ack_source": "precomputed_partial_asr",
|
||||
},
|
||||
)
|
||||
await self._speak_text(actor, ack_text, is_greeting=False)
|
||||
if not actor.closed:
|
||||
await self._set_actor_state(actor, "thinking")
|
||||
base_metadata = {
|
||||
"turn_duration_ms": int(len(pcm_bytes) / 16),
|
||||
"media_uuid": actor.registration.media_uuid,
|
||||
"queue_code": actor.registration.queue_code,
|
||||
"voice_v2_enabled": actor.registration.voice_v2_enabled,
|
||||
"response_plan_id": actor.response_plan_id,
|
||||
"playback_generation": actor.playback_generation,
|
||||
"partial_transcript": partial_transcript,
|
||||
"early_intent": partial_intent,
|
||||
}
|
||||
if self._should_use_voice_v2(actor.registration) and not actor.early_ack_started:
|
||||
partial_task = actor.partial_asr_task
|
||||
if partial_task is not None and not partial_task.done():
|
||||
with contextlib.suppress(asyncio.TimeoutError, asyncio.CancelledError):
|
||||
await asyncio.wait_for(asyncio.shield(partial_task), timeout=0.08)
|
||||
partial_transcript = str(actor.partial_transcript or "").strip()
|
||||
partial_intent = str(actor.partial_intent or "").strip() or self._detect_early_intent(partial_transcript)
|
||||
base_metadata["partial_transcript"] = partial_transcript
|
||||
base_metadata["early_intent"] = partial_intent
|
||||
if partial_transcript:
|
||||
await self._emit_early_ack(
|
||||
actor,
|
||||
language=actor.registration.language,
|
||||
metadata=base_metadata,
|
||||
ack_source="precomputed_partial_asr",
|
||||
)
|
||||
elif len(pcm_bytes) >= self._immediate_ack_min_bytes:
|
||||
await self._emit_early_ack(
|
||||
actor,
|
||||
language=actor.registration.language,
|
||||
metadata=base_metadata,
|
||||
ack_source="immediate_turn_close",
|
||||
)
|
||||
|
||||
transcription = await full_asr_task
|
||||
transcript_text = str(transcription.text or "").strip() or partial_transcript
|
||||
@@ -554,12 +594,7 @@ class AudioSocketMediaRuntime:
|
||||
actor.partial_transcript = transcript_text if actor.registration.voice_v2_partial_asr else None
|
||||
actor.partial_intent = self._detect_early_intent(transcript_text)
|
||||
metadata = {
|
||||
"turn_duration_ms": int(len(pcm_bytes) / 16),
|
||||
"media_uuid": actor.registration.media_uuid,
|
||||
"queue_code": actor.registration.queue_code,
|
||||
"voice_v2_enabled": actor.registration.voice_v2_enabled,
|
||||
"response_plan_id": actor.response_plan_id,
|
||||
"playback_generation": actor.playback_generation,
|
||||
**base_metadata,
|
||||
"partial_transcript": actor.partial_transcript,
|
||||
"early_intent": actor.partial_intent,
|
||||
}
|
||||
@@ -581,24 +616,12 @@ class AudioSocketMediaRuntime:
|
||||
decision = await asyncio.wait_for(asyncio.shield(decision_task), timeout=self._v2_ack_wait_seconds)
|
||||
except asyncio.TimeoutError:
|
||||
if not actor.early_ack_started:
|
||||
ack_kind = self._ack_kind_for_intent(actor.partial_intent or "unknown")
|
||||
ack_text = self._ack_text(transcription.language or actor.registration.language, ack_kind)
|
||||
actor.early_ack_started = True
|
||||
await self._plan_reply_segment(
|
||||
await self._emit_early_ack(
|
||||
actor,
|
||||
ack_text,
|
||||
kind="ack",
|
||||
metadata={
|
||||
**metadata,
|
||||
"partial_transcript": actor.partial_transcript,
|
||||
"early_intent": actor.partial_intent,
|
||||
"ack_kind": ack_kind,
|
||||
"phase": "ack",
|
||||
},
|
||||
language=transcription.language or actor.registration.language,
|
||||
metadata=metadata,
|
||||
ack_source="decision_timeout",
|
||||
)
|
||||
await self._speak_text(actor, ack_text, is_greeting=False)
|
||||
if not actor.closed:
|
||||
await self._set_actor_state(actor, "thinking")
|
||||
decision = await decision_task
|
||||
else:
|
||||
decision = await decision_task
|
||||
|
||||
Reference in New Issue
Block a user