Распознавание речи

С чем сюда приходят

О чём эта страница

Голосовое управление стримом: вы говорите вслух, что хотите, а умный ИИ ассистент это делает. Запуск прогнозов голосом, проведение опроса, переключение сцены в OBS, смена названия и категории, нарезка клипа, сообщение в чат, включение умной розетки — всё это, не отпуская мышь посреди игры.

Голосовые команды для стримеров без облака работают наполовину: речь распознаётся на вашем компьютере, а отвечает и действует ИИ, и каждая команда тратит кредиты.

Настройка занимает два экрана, и они отвечают на разные вопросы:

Распознавание работает на вашем компьютере, поэтому звук никогда его не покидает. К ИИ уходит только сам запрос — и только после того, как приложение решит, что вы обращались к боту; за этот запрос вы и платите.

Как настроить

1. Выберите модель распознавания

Голос → Распознавание, блок Модель распознавания. Выберите одну и нажмите Скачать — это разовая загрузка, после которой распознавание работает офлайн. В строке для каждой модели указано, сколько памяти она занимает и как быстро работает на вашей видеокарте и на вашем процессоре: выберите ту, чьи показатели вас устраивают, а не самую большую.

Пока модель не скачана, ничего не слышно, и плитка говорит Распознавание не готово — это не тишина, а отсутствующая модель.

2. Микрофон и язык

Блок Микрофон и язык. Найти микрофоны показывает их реальные названия; без этого используется системный микрофон по умолчанию.

Установите Язык, на котором вы говорите. Если оставить Определять на слух, каждая фраза проходит через дополнительную проверку, поэтому распознавание примерно в два раза медленнее.

3. Выберите, когда слушать

Блок Когда слушать, и это самый важный выбор.

4. Назовите бота, если микрофон открыт всегда

Блок Как вы называете бота. Произнесите имя, и остальная часть фразы пойдёт боту: «Nova, запусти опрос».

Оставьте имя пустым, и каждая ваша фраза пойдёт боту — и каждая из них стоит кредитов. Экран говорит об этом красным цветом, пока микрофон открыт, а имя отсутствует. При По удержанию клавиши пустое имя допустимо: клавиша является триггером.

5. Слово для остановки озвучки

Произнесите его, пока бот говорит, и он сразу замолкает. Имя здесь не нужно — к тому времени, как вы его произнесёте, бот уже закончит.

Оставьте поле пустым, и будет использовано слово для вашего языка: *stop*, *стоп*, *alto*, *pare*, *stopp*.

6. Разрешите нужные действия

Чат-бот → Голосовое управление. Каждое действие — это карточка с ценой в кредитах и переключателем. Всё, что нельзя отменить, изначально выключено.

Нет списка волшебных фраз. Бот понимает, что вы имели в виду, поэтому «сделай клип», «заклипай это» и «сохрани этот момент» приводят к одному действию. Названия, которые он может использовать — сцены OBS, кнопки панели управления, умные розетки, исходы прогнозов — берутся из того, что фактически подключено, поэтому он не может придумать сцену, которой у вас нет.

Что он может делать

ДействиеСкажите что-то вроде
Запустить опрос«запусти опрос: какая карта — Dust или Mirage»
Завершить опрос«заверши опрос»
Запустить прогноз«запусти прогноз: победим ли мы в этой игре, да или нет»
Закрыть ставки«закрой ставки»
Завершить и выплатить«мы победили, выплати»
Отменить и вернуть«отмени прогноз, верни очки»
Переключить сцену OBS«переключись на сцену Break»
Изменить название и категорию«установи название на Chill coding»
Сохранить клип«заклипай это»
Написать в чат«скажи в чат, что стрим закончится через десять минут»
Нажать кнопку на панели управления«нажми Ad break»
Переключить умную розетку«включи лампу на минуту»

Двенадцать, и это весь список. Клипы, название, опросы и прогнозы идут через Twitch; на YouTube и Kick ассистент пишет в чат, переключает сцены и жмёт кнопки Панели управления. Одна фраза — одно действие: «закрой ставки и переключи сцену» сделает только первое.

Всё, что не является действием, — это обычный ответ: спросите, какая погода, сколько идёт стрим, во что вы играли на прошлой неделе, какие у вас команды чата, о чём вы спрашивали минуту назад.

Спрашивать перед тем, что нельзя отменить

Включено по умолчанию. Бот называет исход — «Завершение прогноза: „Мы победим“» — и ждёт «да». Он называет исход, а не действие, специально: вы подтверждаете то, что нельзя взять назад.

Выключите это, и бот просто сделает действие. Быстрее, и назад пути не будет.

Где вы видите, что произошло

Плитка Эфир: Голос на панели управления ведёт ленту: ваши фразы и ответы бота, по порядку. Цвет полосы слева показывает, чем всё закончилось — синий для ответа, зелёный для выполненного действия, жёлтый для встречного вопроса, красный для отказа с указанием причины рядом.

По умолчанию бот произносит короткую версию вслух — «Опрос запущен» — а подробности попадают в эту ленту. Если у вас нет второго экрана, чтобы их читать, включите Зачитывать результат полностью на экране Голосового управления.

Три кнопки в заголовке плитки:

Сколько это стоит

Голосовое управление — платная возможность. Половина, которая слышит, работает на вашем компьютере и к счёту ничего не добавляет; половина, которая понимает и действует, — это ИИ, и платите вы именно за неё.

Когда это не работает

Вообще ничего не слышно. Проверьте, скачана ли модель, затем используйте Проверить микрофон — произнесите фразу в течение четырёх секунд, и приложение покажет, что услышало. Если ничего не показывает, увеличьте Усиление входа или уменьшите Порог речи.

Бот отвечает на каждую фразу. Микрофон в режиме Всё время, а имя пустое. Дайте ему имя или переключитесь на По удержанию клавиши.

Бот вас слышит, но ничего не делает. Действие выключено на экране Голосового управления, или нужная платформа не подключена — карточка говорит, какая именно.

Он говорит: «Я не понял, какую сцену вы имели в виду». Услышанное имя не совпадает ни с чем из подключённого. Названия сцен берутся из OBS, названия кнопок — с панели управления; произносите имя так, как оно там написано.

Он отвечает не о том, хотя услышал верно. Перед ответом приложение чинит услышанное по именам, которые знает, — сцены, устройства, кнопки, — и редкое ваше слово может замениться одним из них. Впишите это слово на Голос → Распознавание, на вкладке Имена, которые важно не переврать: этот список читает и починка, а слово из него не подменяется никогда.

В списке стоит «Выбранный раньше микрофон (не найден)». Устройства больше нет в системе — выдернули, переименовали или его забрала другая программа. Распознавание при этом не замолкает: оно переходит на системный микрофон по умолчанию. Нажмите Найти микрофоны, выберите нужный и сохраните.

Написано «Распознавание не запустилось». Не загрузился движок, и микрофон тут ни при чём — строкой ниже стоит то, что ответила система. Сначала обновите приложение: сборки до 0.14.2 уезжали без одной из системных библиотек Windows, и на чистой системе распознавание не запускалось вовсе. Если надпись осталась и после обновления, отправьте в поддержку логи вместе с этой строкой.