На этой неделе автор XDA заметил, что недавние сборки VS Code тихо включают в себя модель локального распознавания речи. Никакого запроса в облако, никакого ключа API OpenAI, никаких данных, покидающих машину. По их словам, качество транскрипции было «удивительно хорошим». Эта новость совпадает с тем, что произошло в более широком сообществе open-source за последние два года: модели Whisper-класса теперь работают на ноутбуке в реальном времени, не отправляя аудио никуда.
Мы протестировали семь настольных приложений для автоматического преобразования речи в код и диктовки в 2026 году. Каждое из них сохраняет аудио на устройстве. Пара приложений была разработана специально для программистов. Остальные — это инструменты общего назначения для диктовки, которые интегрируются с редактором.
Что важно в приложении для автоматического преобразования речи в код
- Все на устройстве. Аудио и транскрипция остаются на машине, что проверяемо отключением сетевого кабеля.
- Реальное понимание кода. Называние переменной “cammel case getUserId” должно произвести
getUserId, а не “camel case get user id”. - Режим команд. Грамматика голоса для команд редактора: “линия 42”, “удалить слово”, “запустить тест”.
- Низкая задержка. Потоковая транскрипция менее 500 мс кажется пригодной к использованию. Более одной секунды, и мы перестаем ей доверять.
- Кроссплатформенная точность. Качество модели падает для нелатинских языков и сильных акцентов. Хорошие приложения позволяют выбрать большую модель, когда это необходимо.
- Интеграция с редактором. Поддержка VS Code, JetBrains и терминала охватывает большинство рабочих потоков.
Быстрое сравнение
| Приложение | Лучше всего для | Бесплатный план | Начальная цена | Платформы |
|---|---|---|---|---|
| whisper.cpp | Bare-metal Whisper везде | Полное приложение | Бесплатно, open source | Windows, macOS, Linux |
| Talon Voice | Программирование без рук с реальной грамматикой | Бесплатный уровень | Около $15/месяц Pro (опционально) | Windows, macOS, Linux |
| Serenade | Голосовые команды внутри VS Code | Бесплатный уровень | Около $10/месяц Pro | Windows, macOS, Linux |
| Vosk | Маленькие встраиваемые модели | Полный инструментарий | Бесплатно, open source | Windows, macOS, Linux |
| WhisperKit | Родной Whisper для Apple Silicon | Полный фреймворк | Бесплатно, open source | macOS |
| Wispr Flow | Системная диктовка с качеством | 7-дневный пробный период | Около $12/месяц | macOS, Windows |
| SuperWhisper | Меню-бар Whisper на macOS | Бесплатный уровень | Около $9 одноразово или lifetime уровень | macOS |
Приложения
1. whisper.cpp — лучшее bare-metal автоматическое преобразование речи
whisper.cpp — это C++ порт Whisper от OpenAI, созданный Георгием Gergovым. Он работает на CPU, на Apple Silicon через Metal и на Nvidia GPU через CUDA. Потоковое транскрипция в реальном времени работает с моделью small.en или medium.en на любом ноутбуке последних пяти лет. Весь runtime — это один бинарный файл; Python не требуется.
Где это подводит: это библиотека, а не графический интерфейс. Получение текста в целевое приложение требует написания скрипта, который направляет в wl-copy, xdotool или AppleScript.
Цены:
- Бесплатно: Полный исходный код, лицензия MIT
- Платно: Нет
Платформы: Windows, macOS, Linux
Загрузка: whisper.cpp на GitHub
Вывод: Каждый инструмент автоматического преобразования речи в этом списке либо использует whisper.cpp под капотом, либо конкурирует с ним. Начните отсюда.
2. Talon Voice — лучше всего для программирования без рук
Talon Voice — это то, что используют давние разработчики с RSI (повторяющимися травмами напряжения) для написания кода полностью голосом. Система грамматики понимает camelCase, snake_case, SCREAMING_SNAKE и все движения редактора, которые мы только можем себе представить. Talon работает в режиме «по умолчанию в автономном режиме» с собственным движком распознавания речи (модели Conformer, а не Whisper).
Где это подводит: кривая обучения реальна. Написание персонализированных грамматик требует целого дня, прежде чем приложение окупится. Поддерживаемые сообществом языковые пакеты (talon-community) необходимы.
Цены:
- Бесплатно: Полное приложение для личного использования
- Платно: Уровень поддержки около $15/месяц разблокирует большую модель и приоритетные обновления (опционально)
Платформы: Windows, macOS, Linux
Загрузка: Загрузки Talon Voice
Вывод: Золотой стандарт для программирования без рук. Если мы пишем для заработка, Talon стоит недели настройки.
3. Serenade — лучше всего для управления голосом в VS Code
Serenade находится внутри VS Code, IDE JetBrains и терминалов, прослушивает структурированные команды (“add function foo taking user”) и производит соответствующий код. Запускает локальную модель речи на современном оборудовании.
Где это подводит: бесплатный уровень ограничивает ежедневные голосовые минуты. Грамматика команд строже, чем у Talon; свободная диктовка — это не его сильная сторона.
Цены:
- Бесплатно: Ограниченные ежедневные голосовые минуты
- Платно: Pro около $10/месяц
Платформы: Windows, macOS, Linux
Загрузка: Загрузки Serenade
Вывод: Для легкого редактирования голосом в mainstream IDE, Serenade требует меньше настройки, чем Talon.
4. Vosk — лучше всего для маленького офлайн инструментария распознавания речи
Vosk — это инструментарий распознавания речи от Alpha Cephei. Модели начинаются с 50MB (меньше, чем крошечная модель whisper.cpp) и работают на оборудовании Raspberry Pi. Родные привязки для Python, Node, C#, Java и Go.
Где это подводит: точность ниже, чем у моделей Whisper-класса на общем английском языке. Лучше всего подходит для грамматик команд, слов пробуждения и ограниченного словаря.
Цены:
- Бесплатно: Полный инструментарий и модели по умолчанию (Apache 2.0)
- Платно: Нет
Платформы: Windows, macOS, Linux, Android, iOS
Загрузка: Загрузки Vosk
Вывод: Не выбор для свободной диктовки. Отлично подходит для написания слова пробуждения или плотной грамматики команд в существующее приложение.
5. WhisperKit — лучше всего для стека Apple Silicon Whisper
WhisperKit — это пакет Swift от Argmax, который запускает Whisper на Apple Neural Engine. На Mac серии M, medium.en транскрибирует со скоростью 30-60x в реальном времени, используя однозначный ватт.
Где это подводит: только macOS. Построение на его основе означает написание Swift.
Цены:
- Бесплатно: Полный исходный код, MIT
- Платно: Нет
Платформы: macOS, iOS
Загрузка: WhisperKit на GitHub
Вывод: Библиотека, которую теперь использует каждое серьезное приложение для диктовки на Mac. Не то, что мы устанавливаем напрямую, но причина, по которой SuperWhisper и Wispr Flow кажутся молниеносными на Apple Silicon.
6. Wispr Flow — лучше всего для полированной системной диктовки
Wispr Flow — это что-то ближайшее к опыту “просто говорите в любое текстовое поле”. Триггер горячей клавишей, говорите, отпускайте, и транскрибированный текст вставляется туда, где находится курсор. Пунктуация, заглавизация и дружественное к коду форматирование все происходят на устройстве.
Где это подводит: платное после пробного периода. macOS — это зрелая сборка; Windows еще догоняет по опциям моделей и управлению меню-барам.
Цены:
- Бесплатно: 7-дневный пробный период
- Платно: Около $12/месяц
Платформы: macOS, Windows
Загрузка: Официальный сайт Wispr Flow
Вывод: Если диктовка должна ощущаться как часть ОС, это наименее обременительный платный вариант.
7. SuperWhisper — лучше всего для офлайн меню-бар Whisper на macOS
SuperWhisper — это автономное приложение меню-бара, которое запускает Whisper локально, транскрибирует в любое активное текстовое поле и может после-обработать вывод с помощью локальной LLM (Ollama, LM Studio или встроенные модели Apple).
Где это подводит: только macOS. Цена за один раз была бы скромна для приложения только для Mac, но уровень “lifetime” обновления все еще существует и стоит цены для ежедневных пользователей.
Цены:
- Бесплатно: Базовый уровень с моделями по умолчанию
- Платно: Около $9 одноразово или уровень lifetime для более широкого каталога моделей
Платформы: macOS
Загрузка: Официальный сайт SuperWhisper
Вывод: Пользователи Mac, которые хотят автономную диктовку без прокладки трубопровода: установите это за пять минут и пропустите остальное.
Как выбрать правильный
- Мы хотим лучший бесплатный вариант кроссплатформы: whisper.cpp, управляемый маленьким скриптом-обертке.
- Мы пишем код полностью голосом: Talon Voice.
- Мы хотим голосовые команды внутри VS Code: Serenade.
- Мы используем Mac и хотим нулевую настройку: SuperWhisper или Wispr Flow.
- Мы встраиваем речь в существующее приложение: Vosk (крошечный footprint) или WhisperKit (Apple Silicon).
FAQ
Действительно ли автономное распознавание речи так же хорошо, как облачная диктовка? Для английского языка whisper-large-v3, работающий локально, находится в пределах волоса от того, что возвращают облачные сервисы диктовки. Неанглийские языки все еще отстают от облачных предложений, но разрыв сокращается с каждым выпуском модели.
Могу ли я запустить это на CPU без GPU? Да. whisper.cpp, Vosk, Talon и Serenade все работают на CPU. Whisper-medium работает на скорости реального времени на любом современном ноутбучном CPU.
В чем разница между Whisper и Vosk? Whisper — это большая модель на основе transformer, обученная на многоязычном аудио; точность высокая, модели тяжелые. Vosk использует меньшие модели, оптимизированные для потока; точность ниже для общей диктовки, но задержка и footprint лучше для встроенного использования.
Сохраняет ли любое из этих приложений аудио на устройстве навсегда? Да. whisper.cpp, Vosk, WhisperKit, Talon (в конфигурации по умолчанию) и SuperWhisper все в режиме offline. Serenade и Wispr Flow по умолчанию используют на-устройстве модели, но проверьте параметры, если мы обрабатываем конфиденциальное аудио.
Диктовка быстрее, чем печать? Для прозы да, как только мы адаптируемся. Для кода, это соответствует касанию печати после нескольких часов практики с Talon или Serenade. Большой выигрыш — это возможность работать через травму запястья без потери дня.