Суть урока
Печатать промпты (запросы к AI) вручную — не единственный способ. Есть три способа говорить с Claude Code голосом: отдельные приложения для диктовки (например, Aqua Voice), встроенный /voice режим и локальный Whisper для тех кто не хочет отправлять аудио в облако. Когда руки заняты или мысли приходят быстрее пальцев — голос выигрывает.
Ключевые концепции
- Aqua Voice — специализированный STT (эс-ти-ти, Speech-to-Text — распознавание речи) с фокусом на технические термины
- Native
/voiceрежим — встроенная голосовая диктовка Claude Code - Whisper API (эй-пи-ай — интерфейс программирования) (OpenAI) — облачная транскрибация, универсальная
- Локальный Whisper — транскрибация без отправки в облако
- VoiceMode MCP (эм-си-пи — протокол контекста модели) — Whisper STT + Kokoro TTS (ти-ти-эс, Text-to-Speech — синтез речи из текста) для двусторонней голосовой коммуникации
- Диктовка в любом приложении — Aqua Voice, Wispr Flow, MacWhisper: говоришь, текст вставляется туда, где стоит курсор
Теория
Aqua Voice: почему именно для разработчиков
Обычные голосовые ассистенты (Siri, Google Dictation) плохо справляются с техническими терминами:
claude-sonnet-5-5→ "клод сонет файв файв"npm install -g→ "эн пи эм инсталл джи"Anthropic API key→ "антропик эйпиай кей" (угадай как)
Aqua Voice настроен на технические термины, команды bash (баш — язык команд терминала), названия библиотек и паттерны кода — по заявлению разработчиков.
Характеристики (на октябрь 2026, по сайту сервиса):
| Параметр | Значение |
|---|---|
| Назначение | Диктовка с фокусом на технические термины |
| Точность | Сервис заявляет 97.3% на собственном тесте AISpeak (данные производителя, независимо не проверены) |
| Языки | Заявлено 49; поддержку русского проверь на сайте перед покупкой |
| Интеграция | System-wide (работает везде) |
| Платформы | Основная платформа macOS; наличие других версий смотри на сайте |
| Цена | Есть бесплатный уровень с лимитом слов и платные планы с безлимитом слов; актуальные цены на сайте |
Альтернативы с заявленной поддержкой русского (на октябрь 2026): Wispr Flow (Mac, Windows, iPhone и Android, 100+ языков, бесплатный уровень с недельным лимитом слов) и MacWhisper (работает локально на Mac, 100+ языков, основные функции бесплатны). Каталог и актуальные условия: Инструменты.
Как работает:
- Нажал горячую клавишу (настраивается)
- Говоришь — видишь waveform в статус-баре
- Отпустил клавишу → текст вставляется куда стоит курсор
- Работает в VS Code, Terminal, браузере, любом поле ввода
Установка:
# Через сайт
# aquavoice.com → Get Started on Mac → скачать и установитьПервая настройка:
- Запустить Aqua Voice
- System Settings → Privacy & Security → Microphone → разрешить
- Настроить горячую клавишу (рекомендую Option+Space или Cmd+Shift+V)
- Выбрать режим работы под свои задачи (список режимов смотри в настройках приложения)
Native /voice режим в Claude Code
В Claude Code есть встроенная голосовая диктовка — без сторонних приложений.
Активация:
# В Claude Code написать /voice # Выбрать режим: удержание клавиши или нажатие-нажатие /voice hold /voice tap
Что умеет:
- Режим hold (по умолчанию): держишь Space → говоришь → отпускаешь → текст вставляется в запрос
- Режим tap: нажал Space → говоришь → нажал ещё раз → запрос отправлен
- Расшифровка настроена на термины программирования (regex, OAuth, JSON), название проекта и ветки git подсказываются автоматически
- Работает в терминальном CLI и в расширении VS Code; не работает в облачных сессиях и по SSH
- Нужен вход через аккаунт claude.ai (не по API-ключу); расшифровка не расходует токены и лимиты тарифа
- Язык диктовки берётся из настройки
language(/config); по умолчанию английский, русский поддерживается: выбери его, иначе текст получится искажённым - Аудио отправляется на серверы Anthropic для расшифровки: для конфиденциальных записей используй локальный Whisper
Отличие от Aqua Voice:
| Параметр | /voice режим |
Aqua Voice |
|---|---|---|
| Доступность | Только в Claude Code (CLI и VS Code) | System-wide (везде) |
| Настройка | /voice и выбор языка |
5 минут |
| Техническая точность | Настроена на термины программирования | Заявлено 97.3% (данные производителя) |
| Цена | Не расходует токены и лимиты тарифа | Бесплатный уровень и платные планы |
| Кастомизация | Режимы hold/tap, настраиваемая клавиша | Горячие клавиши, режимы |
| Офлайн | Нет (аудио уходит на серверы Anthropic) | Уточни на сайте |
Рекомендация: /voice для быстрого старта и случайного использования. Aqua Voice — если голосовой ввод станет основным.
Whisper API: облачная транскрибация
OpenAI Whisper — популярная модель транскрибации. Через API она доступна как модель whisper-1, оплата идёт за минуту аудио. У OpenAI есть и более новые модели распознавания (например, gpt-4o-transcribe и gpt-4o-mini-transcribe): актуальные цены смотри на странице цен OpenAI.
Использование через Python (Питон — язык программирования):
import openai
import sounddevice as sd
import numpy as np
import scipy.io.wavfile as wav
import tempfile
client = openai.OpenAI() # ключ берётся из переменной окружения OPENAI_API_KEY
def record_and_transcribe(duration_seconds=10):
"""Записывает аудио и транскрибирует через Whisper"""
print(f"Запись {duration_seconds} секунд... (говорите!)")
# Запись
sample_rate = 16000
recording = sd.rec(
int(duration_seconds * sample_rate),
samplerate=sample_rate,
channels=1
)
sd.wait()
print("Транскрибирую...")
# Сохраняем во временный файл
with tempfile.NamedTemporaryFile(suffix=".wav", delete=False) as tmp:
wav.write(tmp.name, sample_rate, recording)
with open(tmp.name, "rb") as audio_file:
transcription = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
language="ru" # или "en", или убрать для автодетекта
)
return transcription.text
# Пример использования с Claude
import anthropic
claude = anthropic.Anthropic() # ключ берётся из переменной окружения ANTHROPIC_API_KEY
while True:
user_input = record_and_transcribe(duration_seconds=8)
print(f"Вы: {user_input}")
if "стоп" in user_input.lower():
break
response = claude.messages.create(
model="claude-sonnet-5-5",
max_tokens=1000,
messages=[{"role": "user", "content": user_input}]
)
print(f"Claude: {''.join(b.text for b in response.content if b.type == 'text')}")Установка зависимостей:
pip install openai sounddevice scipy numpy anthropicЛокальный Whisper: полная приватность
Для задач где нельзя отправлять аудио в облако (клиентские переговоры, конфиденциальные данные).
# Установка
pip install openai-whisper ffmpeg-python
# На Mac: brew install ffmpegimport whisper
# Загружаем модель (один раз, кешируется)
# tiny=39MB, base=74MB, small=244MB, medium=769MB, large=1.5GB
model = whisper.load_model("small") # баланс скорость/качество
def transcribe_local(audio_path: str, language: str = "ru") -> str:
"""Транскрибирует аудио локально без облака"""
result = model.transcribe(
audio_path,
language=language,
fp16=False # fp16=True если есть GPU
)
return result["text"]
# Пример
text = transcribe_local("запись.wav")
print(text)Сравнение моделей Whisper:
| Модель | Размер | Скорость (CPU, ориентировочно) | Качество |
|---|---|---|---|
| tiny | 39 МБ | ~10x реального времени | Базовое |
| base | 74 МБ | ~7x реального времени | Нормальное |
| small | 244 МБ | ~4x реального времени | Хорошее |
| medium | 769 МБ | ~2x реального времени | Очень хорошее |
| large | 1.5 ГБ | ~1x реального времени | Лучшее |
На Apple Silicon быстрее работают оптимизированные реализации (например, whisper.cpp или приложение MacWhisper); стандартный пакет openai-whisper считает на CPU или GPU.
VoiceMode MCP: двусторонний голос
VoiceMode MCP позволяет Claude Code говорить в ответ — не только слышать.
# Установка через плагин Claude Code
claude plugin install voicemode@voicemode
/voicemode:install
/voicemode:converse
# Альтернатива: установщик на Python
uvx voice-mode-installЧто делает:
- STT: Whisper.cpp (локально) или API OpenAI как запасной вариант
- TTS: Kokoro TTS (открытый, работает локально) или API OpenAI
- Интеграция с Claude Code для голосового диалога
Полезно для: парного программирования с AI, code review вслух, диктовки документации.
Практические сценарии
Сценарий 1: Голосовая разработка
Открыл VS Code, включил Aqua Voice
→ Говоришь: "добавь валидацию email в функцию регистрации"
→ Текст вставляется в чат Claude Code
→ Claude пишет код
→ Повторяешь голосом следующую задачуСценарий 2: Голосовой дневник разработчика
#!/usr/bin/env bash
# voice-standup.sh — голосовой стендап каждое утро
RECORDING_FILE="/tmp/standup-$(date +%Y%m%d).wav"
# Записываем голос (90 секунд)
rec -r 16000 -c 1 "$RECORDING_FILE" trim 0 90
# Транскрибируем через Whisper API
TRANSCRIPT=$(curl -s -X POST "https://api.openai.com/v1/audio/transcriptions" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-F file="@$RECORDING_FILE" \
-F model="whisper-1" \
-F language="ru" | jq -r '.text')
# Структурируем через Claude
STANDUP=$(echo "$TRANSCRIPT" | claude -p "
Преобразуй этот голосовой стендап в структурированный формат:
- Что сделал вчера
- Что планирую сегодня
- Блокеры
")
# Сохраняем
echo "$STANDUP" >> ~/standups/$(date +%Y-%m).md
echo "Стендап записан!"Сценарий 3: Транскрибация клиентских переговоров
# Локальный Whisper — аудио не уходит в облако (текст транскрибации дальше уходит в Claude API)
# Записывай разговоры только с согласия участников
import whisper
import anthropic
model = whisper.load_model("medium")
claude = anthropic.Anthropic()
# Транскрибируем запись встречи
transcript = model.transcribe("meeting-2026-05-09.mp3", language="ru")
# Извлекаем задачи через Claude
response = claude.messages.create(
model="claude-sonnet-5-5",
max_tokens=2000,
messages=[{
"role": "user",
"content": f"Из этой транскрибации встречи извлеки: "
f"список задач с ответственными, ключевые решения, "
f"вопросы без ответа.\n\nТранскрибация:\n{transcript['text']}"
}]
)
print("".join(b.text for b in response.content if b.type == "text"))macOS Dictation: бесплатная альтернатива
Встроенная в macOS функция диктовки (во многих случаях работает без интернета, это зависит от языка и версии macOS):
System Settings → Keyboard → Dictation → On
Горячая клавиша: дважды нажать Fn (или настроить)
Язык: Russian (поддерживается)Плюсы: бесплатно, часто офлайн, работает везде Минусы: хуже справляется с техническими терминами, нет API
Практика
- Включи macOS Dictation (System Settings → Keyboard) — попробуй голосом написать промпт в Claude Code
- Установи и настрой Aqua Voice (aquavoice.com) или другой вариант диктовки — сравни точность на технических терминах
- Создай скрипт
voice-note.shкоторый записывает заметку голосом и сохраняет в Markdown файл - (опционально) Подключи VoiceMode MCP для двустороннего голосового диалога
Инструменты и ресурсы
- Aqua Voice — специализированный STT для разработчиков
- Claude Code: voice dictation — документация по
/voice - Wispr Flow и MacWhisper — альтернативы для диктовки, см. каталог Инструменты
- OpenAI Whisper API — облачная транскрибация
- OpenAI Whisper (локальный) — GitHub репозиторий
- VoiceMode MCP — двусторонний голос для Claude
- Kokoro TTS — открытый Text-to-Speech
- macOS Dictation — System Settings → Keyboard → Dictation
Ключевые выводы
Aqua Voice — один из вариантов технического голосового ввода: работает system-wide во всех приложениях. Цены и поддержку русского проверяй на сайте.
Native
/voiceрежим в Claude Code — почти нулевая настройка, не расходует токены, нужен вход через claude.ai. Для случайного использования — достаточно. Для постоянного ввода во всех приложениях — отдельное приложение для диктовки.
Локальный Whisper — для приватных данных. Транскрибация клиентских переговоров, внутренних встреч — всё остаётся на твоей машине.
Следующий урок
→ Видеомонтаж через Claude Code — FFmpeg, DaVinci Resolve MCP, Remotion
Отметка хранится только в этом браузере и никуда не отправляется. Мой прогресс