Стенд транскрибации звонков

Whisper large-v3 · GigaAM-v3 (e2e) · T-one — локально в браузере. Дорожки «менеджер / клиент», тайминги реплик, перебивания, доля тишины.
Определяю окружение…
⚠️ Страница открыта без cross-origin isolation — WASM работает в один поток, инференс будет заметно медленнее. Запустите через python3 server.py из папки стенда и откройте http://localhost:8017/.

1. Запись звонка (mp3/wav)

Перетащите файл сюда или кликните для выбора.
Стерео из телефонии: левый канал — менеджер, правый — клиент (можно поменять).
📼 длительность каналы частота

2. Модели

Самая мощная версия: 1.55 млрд параметров. Универсал (99 языков), ставит пунктуацию. Используется сжатая 4-битная квантованная версия q4 (~1.2 ГБ суммарно).
  • Разработчик: OpenAI (США)
  • Лицензия: MIT — коммерческое использование бесплатно ✓
  • Скачивается: ~1.2 ГБ (q4)
  • ОЗУ в работе: ≈1.5–2 ГБ
Самая мощная версия: e2e-CTC fp32, 220 млн параметров. Лучшее опубликованное качество на русском, обучена в т.ч. на колл-центрах; ставит пунктуацию и пишет числа цифрами.
  • Разработчик: SberDevices (Сбер) (Россия)
  • Лицензия: MIT — коммерческое использование бесплатно ✓
  • Скачивается: 885 МБ (fp32)
  • ОЗУ в работе: ≈2–2.5 ГБ
Единственная версия: 71.6 млн параметров. Специалист по русской телефонии 8 кГц, потоковая архитектура (может работать в реальном времени). Пунктуацию не ставит.
  • Разработчик: T-Technologies (Т-Банк) (Россия)
  • Лицензия: Apache 2.0 — коммерческое использование бесплатно ✓
  • Скачивается: 144 МБ (fp16)
  • ОЗУ в работе: ≈0.5 ГБ

3. Дорожки и статистика разговора

менеджер клиент перебивание (говорят оба) тишина

4. Транскрипции

Сводка по скорости

МодельВариантУстройствоЗагрузка+инициализация ИнференсRTF×Символов
RTF× — во сколько раз быстрее реального времени обработан звук (длительность речи ÷ время инференса; больше — лучше).