🎙️

Qwen Realtime Audio 3.0

Alibaba DashScope / Clodex • Live Speech & Text
Отключено
Модель: flash
Handshake: — ms
Скорость: 0 tok/s

Голосовая Студия

Hands-free VAD
Ожидание подключения
🎛️ Калибровка порога VAD (Детектор речи) ⚪ Тишина
0% (Тишина) Громкость: 0% 100%
8%
Ниже = слышит шепот, Выше = отсекает шум
950 ms
Сколько мс тишины ждать перед ответом
📖 Справка & Руководство
Развернуть ▼
1 Как начать работу (Старт)

1. В шапке нажмите синюю кнопку «Подключиться» (установится сквозной WebSocket-канал).

2. Нажмите большую кнопку «Начать живой разговор» (она загорится зеленым) — микрофон включится на постоянный прием, модель сама слушает и отвечает.

3. Или используйте кнопку «Зажать для речи (PTT)», если хотите говорить строго по удержанию.

2 Режимы диалога (VAD)
🧠 Smart Turn

Семантический VAD (Qwen 3.0). Анализирует смысл фраз и завершенность мысли. Служебные междометия («угу», «да», «ага») не перебивают речь ИИ.

🎛️ Server VAD

Акустический VAD серверов DashScope по уровню шума и длительности тишины.

💻 Client VAD

Локальный детектор тишины в браузере (для работы с Clodex и слабым интернетом).

🛑 Manual (PTT)

Ручной режим без автоматической детекции пауз.

3 Калибровка детектора речи (VAD)

Порог срабатывания (Threshold): если микрофон ловит фоновый шум/кулеры — увеличьте ползунок до 15–25%. Для шепота снизьте до 5–10%.

Пауза тишины (Silence): сколько миллисекунд тишины ждать перед тем, как ИИ начнет генерировать ответ (500–800 мс оптимально для живой беседы).

🗣️ Перебивание (Barge-in): когда ассистент говорит, вы можете заговорить голосом — аудио мгновенно оборвется, и модель переключится на прослушивание вашей новой реплики.

4 Студия клонирования голоса

Нажмите «✨ Студия клонов» над списком голосов. Запишите 10 секунд речи в микрофон или перетащите WAV/MP3 файл. Голос зарегистрируется в DashScope и сохранится в вашем браузере в списке клонов.

5 Метрики скорости & Мышление

TTFT (Time To First Text): задержка до появления первого слова ответа (обычно ~350–500 мс).

TTFA (Time To First Audio): задержка до первого аудио-пакета в динамиках.

В блоке «Процесс мышления ИИ» можно в реальном времени наблюдать логику рассуждений модели.

Замеры Скорости & Мышление Модели

TTFT (Первый текст)
ms
Среднее: — ms
🔊
TTFA (Первый звук)
ms
Среднее: — ms
⏱️
Время генерации
ms
Реплик: 0
💰
Токены и Стоимость Тариф Clodex ℹ️
$0.0000
0 токенов (0.00¢)
Ожидание реплики
Секундомер ответа: 00:00.000
1. Запрос
0 ms
2. TTFT (Текст)
3. TTFA (Звук)
4. Завершение
Живой стриминг текста (Слово за словом):
0 токенов (0 tps)
Здесь в реальном времени построчно появляется текст ответа модели во время генерации...
💡
Добро пожаловать в тестер Qwen Audio Realtime Plus!

Вы будете видеть одновременно и текст, и слышать живой голос: каждое слово отображается мгновенно при поступлении из сокета вместе с замерами задержек (TTFT, TTFA, Round-trip, Tokens/sec).

Инспектор WebSocket