Открытый бенчмарк

Измеряем слова, спикеров и сбои.

Daisy не будет публиковать магический процент точности. Бенчмарк — это исполняемый протокол, в котором сырые результаты, версии, эталоны и правила скоринга хранятся вместе и проверяются построчно.

Текущий статус

Нейтральный scorerГотовWER, CER, DER, JER, число спикеров, полнота записи и RTF.
Product runner DaisyГотовИспользует те же archive decoder, финальный профиль Whisper и FluidAudio, что и приложение.
Синтетический smoke pipelineПройденПроверяет только harness. Цифры TTS никогда не считаются доказательством качества продукта.
Публичный baseline AMIОпубликованОдин реальный 17-минутный кейс с четырьмя спикерами, сырым выводом, эталоном, хешами и окружением.
Daisy vs Humla vs OpenWhisprИзмеряетсяПубличных результатов не будет до завершения общего реального/публичного набора.

Первый публичный baseline

AMI ES2004a Mix-Headset · 17:29 · английский · 4 спикера · автоматическое определение числа спикеров. Это один воспроизводимый кейс диаризации, а не заявление обо всех встречах.

СистемаDER ↓JER ↓СпикерыЗаписьRTF ↓
Daisy 1.0.7.5915,68%20,28%4 / 4100%0,122×
HumlaНе измереноНе измереноНе измереноНе измереноНе измерено
OpenWhisprНе измереноНе измереноНе измереноНе измереноНе измерено

Эталон words-only RTTM, collar 0,25 с, overlap учитывается. RTF — медиана трёх warm-прогонов (0,139× / 0,122× / 0,107×). WER/CER остаются пустыми до нормализации эталонной расшифровки. Конкуренты остаются пустыми до получения их неисправленного вывода на том же WAV.

Открыть сырые данные и отчёт

Что измеряем

WER / CER

Ошибки слов и символов после единой мультиязычной нормализации.

DER / JER

Путаница спикеров, пропуски и ложная речь. Имена кластеров не влияют на оценку; overlap учитывается.

Запись

Сохранились ли микрофон и системный звук на всей ожидаемой длительности.

Время

RTF обработки, а для интерактивных сценариев — warm p50/p95.

Восстановление

Сон, закрытие крышки, смена устройства, force-quit и сохранность пригодного архива.

Данные / MCP

Что экспортируется без сервиса вендора и получают ли актуальные MCP-клиенты рабочие tools.

Единая матрица тестов

Длительность
15 / 60 / 180 минут
Язык
Английский / русский / mixed RU↔EN
Спикеры
2 / 4 / 6; auto и подсказанное число фиксируются раздельно
Аудио
Чистая речь / шум / overlap и cross-talk
Запись
Микрофон + системный звук, включая сбои и восстановление
Прогоны
Три warm-прогона; точные Mac, OS, версия, модель и настройки

Условия публикации

Результат появится здесь только вместе с эталонной расшифровкой, RTTM при необходимости, сырым неисправленным выводом, SHA-256, точной сборкой и настройками моделей, окружением и отчётом scorer. Слабые случаи и недоступные функции остаются в таблице.

Посмотреть harness на GitHubПротокол обновлён 17 августа 2026 года.