LipFlow предлагает бесшумную диктовку: пользователь удерживает клавишу, произносит слова одними губами, а веб-камера передаёт движения модели распознавания. После отпускания клавиши текст вставляется в активное приложение. Требуются Mac с Apple Silicon и macOS 13 или новее.
Разработчик формулирует идею так:
«Никакого микрофона и звука — только ваша веб-камера».
Это перевод описания базового режима из README. Предусмотрен и режим шёпота с микрофоном. В приведённом автором тесте ошибка распознавания слов составила 31,9% только по видео и 6,9% при добавлении звука. Это результаты проекта, а не независимая проверка бесшумной диктовки.
Что распознаёт камера
В основе лежит Auto-AVSR — исследовательская система визуального распознавания речи. Она обучается восстанавливать слова по видеопоследовательности. Авторы базового проекта публикуют модели, инструкции обучения и результаты на наборе LRS3: исследовательская основа доступна для проверки и воспроизведения.
LipFlow добавляет пользовательский сценарий: выделение области рта, распознавание, исправление текста и вставку. Настройка включает 24 тренировочных предложения. На M4 Pro автор заявляет задержку около 1–2 секунд после завершения фразы. Бесшумная артикуляция, предупреждает README, распознаётся хуже обычной речи на видео.
Где распознавание становится догадкой
Коррекция может выполняться локально через Qwen или с помощью Claude. При выборе Claude варианты распознавания и контекст прошлых диктовок отправляются внешней модели. Поэтому заявление о локальной работе нужно соотносить с выбранным режимом. Поддержка русского и латышского в документации не подтверждена.
Языковая модель помогает выбрать осмысленную фразу, но создаёт дополнительный риск: правдоподобный текст может отличаться от задуманного. При практической проверке следует оценивать не только гладкость результата, но и сохранение имён, чисел, отрицаний и необычных формулировок. Исправление ошибки и незаметная подмена смысла внешне могут выглядеть одинаково.
Открытый код с ограничением на модели
Код LipFlow опубликован под MIT, однако файл NOTICE отдельно указывает: загружаемые веса Auto-AVSR связаны с LRS3, предназначенным для некоммерческих исследований, и предлагает считать веса ограниченными тем же назначением. MIT-лицензию приложения нельзя автоматически переносить на весь комплект.
LipFlow интересен как экспериментальный интерфейс ввода: потенциально полезный там, где говорить вслух неудобно. Чтобы оценить его как замену клавиатуре, нужны испытания на реальной бесшумной речи и измерение времени с учётом исправлений. Компьютер уже умеет догадываться по губам; пользователю пока приходится проверять, о чём именно он догадался.
#обзор #ИИ #macOS #РаспознаваниеРечи
@digitaltimeslv
Original in Telegram: https://t.me/digitaltimeslv/10805