Голосовая Студия
1. В шапке нажмите синюю кнопку «Подключиться» (установится сквозной WebSocket-канал).
2. Нажмите большую кнопку «Начать живой разговор» (она загорится зеленым) — микрофон включится на постоянный прием, модель сама слушает и отвечает.
3. Или используйте кнопку «Зажать для речи (PTT)», если хотите говорить строго по удержанию.
Семантический VAD (Qwen 3.0). Анализирует смысл фраз и завершенность мысли. Служебные междометия («угу», «да», «ага») не перебивают речь ИИ.
Акустический VAD серверов DashScope по уровню шума и длительности тишины.
Локальный детектор тишины в браузере (для работы с Clodex и слабым интернетом).
Ручной режим без автоматической детекции пауз.
Порог срабатывания (Threshold): если микрофон ловит фоновый шум/кулеры — увеличьте ползунок до 15–25%. Для шепота снизьте до 5–10%.
Пауза тишины (Silence): сколько миллисекунд тишины ждать перед тем, как ИИ начнет генерировать ответ (500–800 мс оптимально для живой беседы).
🗣️ Перебивание (Barge-in): когда ассистент говорит, вы можете заговорить голосом — аудио мгновенно оборвется, и модель переключится на прослушивание вашей новой реплики.
Нажмите «✨ Студия клонов» над списком голосов. Запишите 10 секунд речи в микрофон или перетащите WAV/MP3 файл. Голос зарегистрируется в DashScope и сохранится в вашем браузере в списке клонов.
TTFT (Time To First Text): задержка до появления первого слова ответа (обычно ~350–500 мс).
TTFA (Time To First Audio): задержка до первого аудио-пакета в динамиках.
В блоке «Процесс мышления ИИ» можно в реальном времени наблюдать логику рассуждений модели.