diff --git a/.fern/metadata.json b/.fern/metadata.json index 62289a3..764f419 100644 --- a/.fern/metadata.json +++ b/.fern/metadata.json @@ -14,5 +14,5 @@ }, "exclude_types_from_init_exports": true }, - "originGitCommit": "26314a9d3199f5e135302c3c3645b6bbb8f556d4" + "originGitCommit": "9b9b2fa1161d85c0e7da5c783a8bc4e2b4dae7c0" } \ No newline at end of file diff --git a/.fern/replay.lock b/.fern/replay.lock index 699a092..7de023c 100644 --- a/.fern/replay.lock +++ b/.fern/replay.lock @@ -72,14 +72,20 @@ generations: cli_version: unknown generator_versions: fernapi/fern-python-sdk: 4.37.0 -current_generation: f7e9b5d993665a16b43eb1d7d442b118fbeffa4b + - commit_sha: c947c8e18fb5d4ba1e156caf3703f84d630c033c + tree_hash: fef739c337b8fcbcfe43233813e255c51551bad6 + timestamp: 2026-09-22T07:54:15.761Z + cli_version: unknown + generator_versions: + fernapi/fern-python-sdk: 4.37.0 +current_generation: c947c8e18fb5d4ba1e156caf3703f84d630c033c patches: - id: patch-13d8e068 content_hash: sha256:97d879ab169016b9abaf1866427a8ebc45af608f69e063a07e5126c9613c329b original_commit: 13d8e0683ffa08bcfc9a381eb9604adf5abdbe0b original_message: "chore: ignore local venv and planning docs" original_author: plutoless - base_generation: f7e9b5d993665a16b43eb1d7d442b118fbeffa4b + base_generation: c947c8e18fb5d4ba1e156caf3703f84d630c033c files: - .gitignore patch_content: | @@ -108,7 +114,7 @@ patches: original_commit: a065088b4c45e2ca7e1bb91b1a899b8444800121 original_message: "fix(vendors): send Speechmatics STT key instead of api_key" original_author: digitallysavvy - base_generation: f7e9b5d993665a16b43eb1d7d442b118fbeffa4b + base_generation: c947c8e18fb5d4ba1e156caf3703f84d630c033c files: - src/agora_agent/types/speechmatics_asr_params.py patch_content: | @@ -251,7 +257,7 @@ patches: original_commit: 33a436b3bdb6f2a6fe4d8987b6536c2f0ac2862e original_message: "fix: address v2.8.0 release review findings" original_author: digitallysavvy - base_generation: f7e9b5d993665a16b43eb1d7d442b118fbeffa4b + base_generation: c947c8e18fb5d4ba1e156caf3703f84d630c033c files: - src/agora_agent/agents/types/start_agents_request_properties_advanced_features.py patch_content: | @@ -312,3 +318,4 @@ patches: frozen = True smart_union = True extra = pydantic.Extra.allow + user_owned: true diff --git a/src/agora_agent/agentkit/presets.py b/src/agora_agent/agentkit/presets.py index f160cee..ce76a2c 100644 --- a/src/agora_agent/agentkit/presets.py +++ b/src/agora_agent/agentkit/presets.py @@ -108,7 +108,7 @@ def infer_asr_preset(asr: typing.Optional[typing.Dict[str, typing.Any]]) -> typi if not asr or asr.get("vendor") != "deepgram": return None params = asr.get("params") or {} - if params.get("key"): + if params.get("api_key"): return None return _DEEPGRAM_MODEL_TO_PRESET.get(_normalize_model_name(params.get("model")) or "") diff --git a/src/agora_agent/agentkit/vendors/stt.py b/src/agora_agent/agentkit/vendors/stt.py index f05fe79..50c7a3f 100644 --- a/src/agora_agent/agentkit/vendors/stt.py +++ b/src/agora_agent/agentkit/vendors/stt.py @@ -97,7 +97,7 @@ def to_config(self) -> Dict[str, Any]: params: Dict[str, Any] = dict(self.additional_params or {}) if self.api_key is not None: - params["key"] = self.api_key + params["api_key"] = self.api_key if self.model is not None: params["model"] = self.model if self.language is not None: diff --git a/src/agora_agent/agents/types/start_agents_request_properties_parameters.py b/src/agora_agent/agents/types/start_agents_request_properties_parameters.py index 33bb237..d3153e9 100644 --- a/src/agora_agent/agents/types/start_agents_request_properties_parameters.py +++ b/src/agora_agent/agents/types/start_agents_request_properties_parameters.py @@ -15,6 +15,7 @@ from .start_agents_request_properties_parameters_silence_config import ( StartAgentsRequestPropertiesParametersSilenceConfig, ) +from .start_agents_request_properties_parameters_speak import StartAgentsRequestPropertiesParametersSpeak class StartAgentsRequestPropertiesParameters(UncheckedBaseModel): @@ -22,6 +23,11 @@ class StartAgentsRequestPropertiesParameters(UncheckedBaseModel): Agent configuration parameters. """ + speak: typing.Optional[StartAgentsRequestPropertiesParametersSpeak] = pydantic.Field(default=None) + """ + Settings for the agent's speak behavior. + """ + silence_config: typing.Optional[StartAgentsRequestPropertiesParametersSilenceConfig] = pydantic.Field(default=None) """ Settings related to agent silence behavior. Does not apply when you integrate a `mllm`. diff --git a/src/agora_agent/agents/types/start_agents_request_properties_parameters_speak.py b/src/agora_agent/agents/types/start_agents_request_properties_parameters_speak.py new file mode 100644 index 0000000..95003bc --- /dev/null +++ b/src/agora_agent/agents/types/start_agents_request_properties_parameters_speak.py @@ -0,0 +1,29 @@ +# This file was auto-generated by Fern from our API Definition. + +import typing + +import pydantic +from ...core.pydantic_utilities import IS_PYDANTIC_V2 +from ...core.unchecked_base_model import UncheckedBaseModel + + +class StartAgentsRequestPropertiesParametersSpeak(UncheckedBaseModel): + """ + Settings for the agent's speak behavior. + """ + + batch: typing.Optional[bool] = pydantic.Field(default=None) + """ + Whether to skip sentence segmentation for speak requests: + - `false`: Skip sentence segmentation. + - Omitted or `true`: Preserve sentence segmentation. + """ + + if IS_PYDANTIC_V2: + model_config: typing.ClassVar[pydantic.ConfigDict] = pydantic.ConfigDict(extra="allow", frozen=True) # type: ignore # Pydantic v2 + else: + + class Config: + frozen = True + smart_union = True + extra = pydantic.Extra.allow diff --git a/src/agora_agent/core/client_wrapper.py b/src/agora_agent/core/client_wrapper.py index ac8bacd..8ce1e55 100644 --- a/src/agora_agent/core/client_wrapper.py +++ b/src/agora_agent/core/client_wrapper.py @@ -26,10 +26,10 @@ def __init__( def get_headers(self) -> typing.Dict[str, str]: headers: typing.Dict[str, str] = { - "User-Agent": "agora-agents/v2.10.0", + "User-Agent": "agora-agents/v2.11.0", "X-Fern-Language": "Python", "X-Fern-SDK-Name": "agora-agents", - "X-Fern-SDK-Version": "v2.10.0", + "X-Fern-SDK-Version": "v2.11.0", **(self.get_custom_headers() or {}), } headers["Authorization"] = httpx.BasicAuth(self._get_username(), self._get_password())._auth_header diff --git a/src/agora_agent/types/asr.py b/src/agora_agent/types/asr.py index 838ea54..dc5461d 100644 --- a/src/agora_agent/types/asr.py +++ b/src/agora_agent/types/asr.py @@ -18,6 +18,7 @@ from .google_asr_params import GoogleAsrParams from .microsoft_asr_params import MicrosoftAsrParams from .open_ai_asr_params import OpenAiAsrParams +from .rtzr_asr_params import RtzrAsrParams from .sarvam_asr_params import SarvamAsrParams from .smallest_ai_asr_params import SmallestAiAsrParams from .speechmatics_asr_params import SpeechmaticsAsrParams @@ -210,6 +211,21 @@ class Config: extra = pydantic.Extra.allow +class Asr_Rtzr(UncheckedBaseModel): + vendor: typing.Literal["rtzr"] = "rtzr" + language: typing.Optional[AsrLanguage] = None + params: RtzrAsrParams + + if IS_PYDANTIC_V2: + model_config: typing.ClassVar[pydantic.ConfigDict] = pydantic.ConfigDict(extra="allow", frozen=True) # type: ignore # Pydantic v2 + else: + + class Config: + frozen = True + smart_union = True + extra = pydantic.Extra.allow + + class Asr_Xai(UncheckedBaseModel): vendor: typing.Literal["xai"] = "xai" language: typing.Optional[AsrLanguage] = None @@ -299,6 +315,7 @@ class Config: Asr_Assemblyai, Asr_Speechmatics, Asr_Sarvam, + Asr_Rtzr, Asr_Xai, Asr_Xfyun, Asr_XfyunBigmodel, diff --git a/src/agora_agent/types/deepgram_asr_params.py b/src/agora_agent/types/deepgram_asr_params.py index 6688333..e1f3656 100644 --- a/src/agora_agent/types/deepgram_asr_params.py +++ b/src/agora_agent/types/deepgram_asr_params.py @@ -17,7 +17,7 @@ class DeepgramAsrParams(UncheckedBaseModel): WebSocket URL for Deepgram's streaming API """ - key: str = pydantic.Field() + api_key: str = pydantic.Field() """ Deepgram API key """ diff --git a/src/agora_agent/types/rtzr_asr.py b/src/agora_agent/types/rtzr_asr.py new file mode 100644 index 0000000..e49023d --- /dev/null +++ b/src/agora_agent/types/rtzr_asr.py @@ -0,0 +1,27 @@ +# This file was auto-generated by Fern from our API Definition. + +import typing + +import pydantic +from ..core.pydantic_utilities import IS_PYDANTIC_V2 +from ..core.unchecked_base_model import UncheckedBaseModel +from .asr_language import AsrLanguage +from .rtzr_asr_params import RtzrAsrParams + + +class RtzrAsr(UncheckedBaseModel): + """ + RTZR ASR configuration. + """ + + language: typing.Optional[AsrLanguage] = None + params: RtzrAsrParams + + if IS_PYDANTIC_V2: + model_config: typing.ClassVar[pydantic.ConfigDict] = pydantic.ConfigDict(extra="allow", frozen=True) # type: ignore # Pydantic v2 + else: + + class Config: + frozen = True + smart_union = True + extra = pydantic.Extra.allow diff --git a/src/agora_agent/types/rtzr_asr_params.py b/src/agora_agent/types/rtzr_asr_params.py new file mode 100644 index 0000000..40f2baa --- /dev/null +++ b/src/agora_agent/types/rtzr_asr_params.py @@ -0,0 +1,82 @@ +# This file was auto-generated by Fern from our API Definition. + +import typing + +import pydantic +from ..core.pydantic_utilities import IS_PYDANTIC_V2 +from ..core.unchecked_base_model import UncheckedBaseModel + + +class RtzrAsrParams(UncheckedBaseModel): + """ + RTZR ASR configuration parameters. + """ + + client_id: str = pydantic.Field() + """ + RTZR client ID. + """ + + client_secret: str = pydantic.Field() + """ + RTZR client secret. + """ + + api_base: typing.Optional[str] = pydantic.Field(default=None) + """ + RTZR API base URL. + """ + + model_name: typing.Optional[str] = pydantic.Field(default=None) + """ + RTZR recognition model name. + """ + + language: typing.Optional[str] = pydantic.Field(default=None) + """ + RTZR recognition language code. Defaults to Korean (`ko`). + """ + + sample_rate: typing.Optional[int] = pydantic.Field(default=None) + """ + Input audio sample rate in Hz. + """ + + encoding: typing.Optional[str] = pydantic.Field(default=None) + """ + Input audio encoding. + """ + + use_itn: typing.Optional[bool] = pydantic.Field(default=None) + """ + Whether to enable inverse text normalization. + """ + + use_disfluency_filter: typing.Optional[bool] = pydantic.Field(default=None) + """ + Whether to filter disfluencies such as stuttering. + """ + + use_profanity_filter: typing.Optional[bool] = pydantic.Field(default=None) + """ + Whether to filter profanity. + """ + + use_punctuation: typing.Optional[bool] = pydantic.Field(default=None) + """ + Whether to add punctuation to the recognized text. + """ + + keywords: typing.Optional[typing.List[str]] = pydantic.Field(default=None) + """ + Keywords to improve recognition accuracy. + """ + + if IS_PYDANTIC_V2: + model_config: typing.ClassVar[pydantic.ConfigDict] = pydantic.ConfigDict(extra="allow", frozen=True) # type: ignore # Pydantic v2 + else: + + class Config: + frozen = True + smart_union = True + extra = pydantic.Extra.allow diff --git a/src/agora_agent/types/sarvam_tts_params.py b/src/agora_agent/types/sarvam_tts_params.py index 855299f..d544dea 100644 --- a/src/agora_agent/types/sarvam_tts_params.py +++ b/src/agora_agent/types/sarvam_tts_params.py @@ -20,32 +20,42 @@ class SarvamTtsParams(UncheckedBaseModel): speaker: str = pydantic.Field() """ - Voice ID (e.g., anushka, abhilash, karun, hitesh, manisha, vidya, arya) + Speaker voice to use. """ target_language_code: SarvamTtsParamsTargetLanguageCode = pydantic.Field() """ - Target language code (e.g., en-IN) + Target language code in BCP-47 format (e.g., `hi-IN`, `bn-IN`, `en-IN`). """ pitch: typing.Optional[float] = pydantic.Field(default=None) """ - Pitch adjustment for the voice + Pitch control for the `bulbul:v2` model. """ pace: typing.Optional[float] = pydantic.Field(default=None) """ - Speed of speech + Speech speed. Defaults to `1.0`. """ loudness: typing.Optional[float] = pydantic.Field(default=None) """ - Volume level of the speech + Audio loudness control for the `bulbul:v2` model. """ - sample_rate: typing.Optional[float] = pydantic.Field(default=None) + speech_sample_rate: typing.Optional[int] = pydantic.Field(default=None) """ - Audio sample rate in Hz + Output speech sample rate in Hz. Defaults to `24000`. + """ + + enable_preprocessing: typing.Optional[bool] = pydantic.Field(default=None) + """ + Whether to normalize English words and numeric entities. Defaults to `false`. + """ + + model: typing.Optional[str] = pydantic.Field(default=None) + """ + TTS model to use. Defaults to `bulbul:v3`. """ if IS_PYDANTIC_V2: diff --git a/tests/custom/test_request_body.py b/tests/custom/test_request_body.py index f5bab70..d06d09e 100644 --- a/tests/custom/test_request_body.py +++ b/tests/custom/test_request_body.py @@ -323,7 +323,7 @@ def test_byok_pipeline_full_properties_shape() -> None: # ASR asr = props["asr"] assert asr["vendor"] == "deepgram" - assert asr["params"]["key"] == "dg-key" + assert asr["params"]["api_key"] == "dg-key" assert asr["params"]["model"] == "nova-2" assert asr["params"]["language"] == "en" @@ -630,7 +630,7 @@ def test_6b_tts_preset_with_byok_llm_and_asr() -> None: properties = dump(call["properties"]) # BYOK ASR: key and model both retained (nothing stripped for BYOK path) - assert properties["asr"]["params"]["key"] == "dg-key" + assert properties["asr"]["params"]["api_key"] == "dg-key" assert properties["asr"]["params"]["model"] == "nova-2" # BYOK LLM key retained assert properties["llm"]["api_key"] == "openai-key" @@ -779,7 +779,7 @@ def test_byok_deepgram_stt_params() -> None: ) props = build_properties(agent, allow_missing={"llm", "tts"}) assert props["asr"]["vendor"] == "deepgram" - assert props["asr"]["params"]["key"] == "dg-key" + assert props["asr"]["params"]["api_key"] == "dg-key" assert props["asr"]["params"]["model"] == "nova-2" assert props["asr"]["params"]["language"] == "en" diff --git a/tests/custom/test_stt_language.py b/tests/custom/test_stt_language.py index 27ce63f..5515097 100644 --- a/tests/custom/test_stt_language.py +++ b/tests/custom/test_stt_language.py @@ -110,13 +110,13 @@ def test_stt_vendor_params_match_documented_shapes() -> None: DeepgramSTT(model="enhanced") assert DeepgramSTT(api_key="dg-key", language="en").to_config()["params"] == { - "key": "dg-key", + "api_key": "dg-key", "language": "en", } - # api_key → wire key "key"; keyterm passes through unchanged + # api_key uses the generated Deepgram ASR field name; keyterm passes through unchanged assert DeepgramSTT(api_key="dg-key", model="nova-3", language="en", keyterm="term").to_config()["params"] == { - "key": "dg-key", + "api_key": "dg-key", "model": "nova-3", "language": "en", "keyterm": "term",