Стенд транскрибации звонков

Whisper large-v3 · GigaAM-v3 (e2e) · T-one — локально в браузере. Дорожки «менеджер / клиент», тайминги реплик, перебивания, доля тишины.
Определяю окружение…
⚠️ Страница открыта без cross-origin isolation — WASM работает в один поток, инференс будет заметно медленнее. Запустите через python3 server.py из папки стенда и откройте http://localhost:8017/.

1. Запись звонка (mp3/wav)

Перетащите файл сюда или кликните для выбора.
Стерео из телефонии: левый канал — менеджер, правый — клиент (можно поменять).
📼 длительность каналы частота

2. Модели

Самая мощная версия, 1.55 млрд параметров (~3.1 ГБ). Универсал: 99 языков, пунктуация. На WebGPU считает в fp16 (качество ≈ fp32); без GPU — сжатая q8 на CPU, заметно медленнее.
Самая мощная версия: e2e-CTC fp32, 220 млн параметров (885 МБ). SOTA на русском, обучена на колл-центрах, ставит пунктуацию и пишет числа цифрами.
Единственная версия: 71.6 млн параметров (144 МБ). Специалист по русской телефонии 8 кГц, потоковая. Пунктуацию не ставит.

3. Дорожки и статистика разговора

менеджер клиент перебивание (говорят оба) тишина

4. Транскрипции

Сводка по скорости

МодельВариантУстройствоЗагрузка+инициализация ИнференсRTF×Символов
RTF× — во сколько раз быстрее реального времени обработан звук (длительность речи ÷ время инференса; больше — лучше).