Распознавание речи
- как управлять стримом голосом
- голосовое управление стримом
- голосовые команды для стримера
- запуск прогнозов голосом
- умный ИИ ассистент для стрима
- можно ли запустить голосом опрос или прогноз
- бот меня не слышит
- голосовые команды не работают
- как переключить сцену в OBS голосом
- бот отвечает на каждую мою фразу
- бот говорит без остановки, и я не могу его прервать
О чём эта страница
Голосовое управление стримом: вы говорите вслух, что хотите, а умный ИИ ассистент это делает. Запуск прогнозов голосом, проведение опроса, переключение сцены в OBS, смена названия и категории, нарезка клипа, сообщение в чат, включение умной розетки — всё это, не отпуская мышь посреди игры.
Голосовые команды для стримеров без облака работают наполовину: речь распознаётся на вашем компьютере, а отвечает и действует ИИ, и каждая команда тратит кредиты.
Настройка занимает два экрана, и они отвечают на разные вопросы:
- Голос → Распознавание — как приложение вас слышит: микрофон, язык, когда слушать, как вы называете бота.
- Чат-бот → Голосовое управление — что боту разрешено делать, когда он вас услышал.
Распознавание работает на вашем компьютере, поэтому звук никогда его не покидает. К ИИ уходит только сам запрос — и только после того, как приложение решит, что вы обращались к боту; за этот запрос вы и платите.
Как настроить
1. Выберите модель распознавания
Голос → Распознавание, блок Модель распознавания. Выберите одну и нажмите Скачать — это разовая загрузка, после которой распознавание работает офлайн. В строке для каждой модели указано, сколько памяти она занимает и как быстро работает на вашей видеокарте и на вашем процессоре: выберите ту, чьи показатели вас устраивают, а не самую большую.
Пока модель не скачана, ничего не слышно, и плитка говорит Распознавание не готово — это не тишина, а отсутствующая модель.
2. Микрофон и язык
Блок Микрофон и язык. Найти микрофоны показывает их реальные названия; без этого используется системный микрофон по умолчанию.
Установите Язык, на котором вы говорите. Если оставить Определять на слух, каждая фраза проходит через дополнительную проверку, поэтому распознавание примерно в два раза медленнее.
3. Выберите, когда слушать
Блок Когда слушать, и это самый важный выбор.
- По удержанию клавиши — микрофон открывается, пока клавиша удерживается, и закрывается, когда вы отпускаете. Назначьте клавишу с помощью Назначить; она не забирается у других программ, поэтому продолжает работать внутри игры. Всё, что вы говорите, удерживая клавишу, идёт боту, и имя не нужно: сама клавиша говорит, что вы обращаетесь к нему.
- Всё время — микрофон остаётся открытым на весь стрим. Теперь приложению нужно отличать вашу речь от запроса, и для этого нужно имя бота.
4. Назовите бота, если микрофон открыт всегда
Блок Как вы называете бота. Произнесите имя, и остальная часть фразы пойдёт боту: «Nova, запусти опрос».
Оставьте имя пустым, и каждая ваша фраза пойдёт боту — и каждая из них стоит кредитов. Экран говорит об этом красным цветом, пока микрофон открыт, а имя отсутствует. При По удержанию клавиши пустое имя допустимо: клавиша является триггером.
5. Слово для остановки озвучки
Произнесите его, пока бот говорит, и он сразу замолкает. Имя здесь не нужно — к тому времени, как вы его произнесёте, бот уже закончит.
Оставьте поле пустым, и будет использовано слово для вашего языка: *stop*, *стоп*, *alto*, *pare*, *stopp*.
6. Разрешите нужные действия
Чат-бот → Голосовое управление. Каждое действие — это карточка с ценой в кредитах и переключателем. Всё, что нельзя отменить, изначально выключено.
Нет списка волшебных фраз. Бот понимает, что вы имели в виду, поэтому «сделай клип», «заклипай это» и «сохрани этот момент» приводят к одному действию. Названия, которые он может использовать — сцены OBS, кнопки панели управления, умные розетки, исходы прогнозов — берутся из того, что фактически подключено, поэтому он не может придумать сцену, которой у вас нет.
Что он может делать
| Действие | Скажите что-то вроде |
|---|---|
| Запустить опрос | «запусти опрос: какая карта — Dust или Mirage» |
| Завершить опрос | «заверши опрос» |
| Запустить прогноз | «запусти прогноз: победим ли мы в этой игре, да или нет» |
| Закрыть ставки | «закрой ставки» |
| Завершить и выплатить | «мы победили, выплати» |
| Отменить и вернуть | «отмени прогноз, верни очки» |
| Переключить сцену OBS | «переключись на сцену Break» |
| Изменить название и категорию | «установи название на Chill coding» |
| Сохранить клип | «заклипай это» |
| Написать в чат | «скажи в чат, что стрим закончится через десять минут» |
| Нажать кнопку на панели управления | «нажми Ad break» |
| Переключить умную розетку | «включи лампу на минуту» |
Двенадцать, и это весь список. Клипы, название, опросы и прогнозы идут через Twitch; на YouTube и Kick ассистент пишет в чат, переключает сцены и жмёт кнопки Панели управления. Одна фраза — одно действие: «закрой ставки и переключи сцену» сделает только первое.
Всё, что не является действием, — это обычный ответ: спросите, какая погода, сколько идёт стрим, во что вы играли на прошлой неделе, какие у вас команды чата, о чём вы спрашивали минуту назад.
Спрашивать перед тем, что нельзя отменить
Включено по умолчанию. Бот называет исход — «Завершение прогноза: „Мы победим“» — и ждёт «да». Он называет исход, а не действие, специально: вы подтверждаете то, что нельзя взять назад.
Выключите это, и бот просто сделает действие. Быстрее, и назад пути не будет.
Где вы видите, что произошло
Плитка Эфир: Голос на панели управления ведёт ленту: ваши фразы и ответы бота, по порядку. Цвет полосы слева показывает, чем всё закончилось — синий для ответа, зелёный для выполненного действия, жёлтый для встречного вопроса, красный для отказа с указанием причины рядом.
По умолчанию бот произносит короткую версию вслух — «Опрос запущен» — а подробности попадают в эту ленту. Если у вас нет второго экрана, чтобы их читать, включите Зачитывать результат полностью на экране Голосового управления.
Три кнопки в заголовке плитки:
- микрофон — переключает между *по удержанию клавиши* и *всё время*, та же настройка, что и на экране распознавания;
- динамик — читать ответы вслух или оставлять их текстом в ленте;
- питание — самая крайняя: бот замолкает, распознавание останавливается, и модель покидает память. Сценарии, запускаемые донатами и очками канала, не затрагиваются — им никогда не нужен был микрофон. Останавливаются только сценарии, запускаемые произнесённой фразой.
Сколько это стоит
Голосовое управление — платная возможность. Половина, которая слышит, работает на вашем компьютере и к счёту ничего не добавляет; половина, которая понимает и действует, — это ИИ, и платите вы именно за неё.
- Голосовая команда — это два запроса к ИИ, а не один: дешёвый этап разбора, который исправляет услышанное и решает, нужен ли интернет, и сам ответ. Карточка для каждого действия показывает цену, которую вы фактически заплатите.
- Само распознавание не тарифицируется. Оно идёт на вашем компьютере, поэтому открытый микрофон ничего не стоит, пока вы не обратились к боту.
- Веб-поиск — десять кредитов. Это происходит только тогда, когда вопрос требует фактов из интернета, и только если включено Разрешить веб-поиск.
Когда это не работает
Вообще ничего не слышно. Проверьте, скачана ли модель, затем используйте Проверить микрофон — произнесите фразу в течение четырёх секунд, и приложение покажет, что услышало. Если ничего не показывает, увеличьте Усиление входа или уменьшите Порог речи.
Бот отвечает на каждую фразу. Микрофон в режиме Всё время, а имя пустое. Дайте ему имя или переключитесь на По удержанию клавиши.
Бот вас слышит, но ничего не делает. Действие выключено на экране Голосового управления, или нужная платформа не подключена — карточка говорит, какая именно.
Он говорит: «Я не понял, какую сцену вы имели в виду». Услышанное имя не совпадает ни с чем из подключённого. Названия сцен берутся из OBS, названия кнопок — с панели управления; произносите имя так, как оно там написано.
Он отвечает не о том, хотя услышал верно. Перед ответом приложение чинит услышанное по именам, которые знает, — сцены, устройства, кнопки, — и редкое ваше слово может замениться одним из них. Впишите это слово на Голос → Распознавание, на вкладке Имена, которые важно не переврать: этот список читает и починка, а слово из него не подменяется никогда.
В списке стоит «Выбранный раньше микрофон (не найден)». Устройства больше нет в системе — выдернули, переименовали или его забрала другая программа. Распознавание при этом не замолкает: оно переходит на системный микрофон по умолчанию. Нажмите Найти микрофоны, выберите нужный и сохраните.
Написано «Распознавание не запустилось». Не загрузился движок, и микрофон тут ни при чём — строкой ниже стоит то, что ответила система. Сначала обновите приложение: сборки до 0.14.2 уезжали без одной из системных библиотек Windows, и на чистой системе распознавание не запускалось вовсе. Если надпись осталась и после обновления, отправьте в поддержку логи вместе с этой строкой.