Spracherkennung
- wie steuere ich den Stream mit meiner Stimme
- kann ich eine Umfrage oder Vorhersage per Sprache starten
- der Bot hört mich nicht
- Sprachbefehle machen nichts
- wie wechsle ich eine OBS-Szene per Sprache
- der Bot antwortet auf jeden Satz, den ich sage
- der Bot redet weiter und ich kriege ihn nicht still
Worum es auf dieser Seite geht
Sprachsteuerung für deinen Stream: Du sagst laut, was du willst, und der KI-Assistent macht es. Vorhersagen per Sprache starten, eine Umfrage laufen lassen, die OBS-Szene wechseln, Titel und Kategorie ändern, einen Clip speichern, eine Zeile in den Chat schreiben, eine smarte Steckdose schalten — alles, ohne mitten im Spiel die Maus loszulassen.
Eingerichtet wird das auf zwei Seiten, und sie beantworten verschiedene Fragen:
- Stimme → Spracherkennung — wie die App dich hört: Mikrofon, Sprache, wann sie zuhört, wie du den Bot rufst.
- Chatbot → Sprachsteuerung — was der Bot tun darf, nachdem er dich gehört hat.
Die Erkennung läuft auf deinem eigenen Rechner, der Ton verlässt den Computer also nie. Zur KI geht nur die Anfrage selbst, und erst nachdem die App entschieden hat, dass du mit dem Bot gesprochen hast — und diese Anfrage ist der Teil, den du bezahlst.
So richtest du es ein
1. Wähle ein Erkennungsmodell
Stimme → Spracherkennung, Block Erkennungsmodell. Wähle eines und drücke Herunterladen — das ist ein einmaliger Download, danach arbeitet die Erkennung offline. Die Zeile jedes Modells sagt, wie viel Speicher es braucht und wie schnell es auf deiner Grafikkarte und auf deinem Prozessor läuft: Nimm das, dessen Zahlen dir passen, nicht das größte.
Solange kein Modell heruntergeladen ist, hört die App nichts, und die Kachel sagt Erkennung ist nicht bereit — das ist keine Stille, das ist ein fehlendes Modell.
2. Mikrofon und Sprache
Block Mikrofon und Sprache. Mikrofone suchen zeigt ihre echten Namen; ohne das wird der Systemstandard genommen.
Stelle Gesprochene Sprache ein. Wenn du es auf Automatisch erkennen stehen lässt, geht jeder Satz durch einen zweiten Durchgang — die Erkennung ist dann etwa doppelt so langsam.
3. Wähle, wann zugehört wird
Block Wann zuhören, und das ist die Entscheidung, auf die es am meisten ankommt.
- Taste gedrückt halten — das Mikrofon öffnet sich, solange die Taste gehalten wird, und schließt sich, wenn du loslässt. Die Taste legst du mit Zuweisen fest; sie wird anderen Programmen nicht weggenommen und funktioniert deshalb auch im Spiel. Alles, was du beim Halten sagst, geht an den Bot, und ein Name ist nicht nötig: Die Taste selbst sagt, dass du mit ihm sprichst.
- Immer — das Mikrofon bleibt den ganzen Stream über offen. Jetzt muss die App dein normales Reden von einer Anfrage unterscheiden, und genau dafür ist der Name des Bots da.
4. Gib dem Bot einen Namen, wenn das Mikrofon offen bleibt
Block Wie du den Bot rufst. Sag den Namen, und der Rest des Satzes geht an den Bot: „Nova, starte eine Umfrage“.
Lässt du den Namen leer, geht jeder Satz an den Bot — und jeder davon kostet Credits. Der Bildschirm sagt das in Rot, solange das Mikrofon offen ist und der Name fehlt. Bei Taste gedrückt halten ist ein leerer Name in Ordnung: Die Taste ist der Auslöser.
5. Wort, das die Sprachausgabe stoppt
Sag es, während der Bot spricht, und er ist sofort still. Der Name wird hier nicht gebraucht — bis du ihn gesagt hast, ist der Bot fertig.
Lass das Feld leer, dann wird das Wort deiner gesprochenen Sprache benutzt: *stop*, *стоп*, *alto*, *pare*, *stopp*.
6. Erlaube die Aktionen, die du willst
Chatbot → Sprachsteuerung. Jede Aktion ist eine Karte mit ihrem Preis in Credits und einem Schalter. Alles, was sich nicht rückgängig machen lässt, ist von Anfang an aus.
Es gibt keine Liste magischer Sätze. Der Bot findet heraus, was du gemeint hast, deshalb landen „Clip erstellen“, „clip das“ und „speichere diesen Moment“ bei derselben Aktion. Die Namen, die er verwenden kann — OBS-Szenen, Schaltflächen im Bedienfeld, smarte Steckdosen, Ergebnisse von Vorhersagen — kommen aus dem, was wirklich verbunden ist; er kann also keine Szene erfinden, die du nicht hast.
Was er kann
| Aktion | Sag so etwas wie |
|---|---|
| Eine Umfrage starten | „starte eine Umfrage: welche Map — Dust oder Mirage“ |
| Die Umfrage beenden | „beende die Umfrage“ |
| Eine Vorhersage starten | „starte eine Vorhersage: gewinnen wir die hier, ja oder nein“ |
| Die Wetten schließen | „schließe die Wetten“ |
| Auflösen und auszahlen | „wir haben gewonnen, zahl aus“ |
| Abbrechen und erstatten | „brich die Vorhersage ab, gib die Punkte zurück“ |
| Die OBS-Szene wechseln | „wechsle zur Pausen-Szene“ |
| Titel und Kategorie ändern | „setze den Titel auf Chill coding“ |
| Einen Clip speichern | „clip das“ |
| In den Chat schreiben | „sag dem Chat, der Stream endet in zehn Minuten“ |
| Eine Bedienfeld-Schaltfläche drücken | „drücke Werbepause“ |
| Eine Steckdose schalten | „schalte die Lampe für eine Minute an“ |
Zwölf, und das ist die ganze Liste. Clips, Titel, Umfragen und Vorhersagen laufen über Twitch; auf YouTube und Kick schreibt der Assistent in den Chat, wechselt Szenen und drückt Schaltflächen im Bedienfeld. Ein Satz ist eine Aktion: „schließe die Wetten und wechsle die Szene“ macht nur das erste von beidem.
Alles, was keine Aktion ist, ist eine ganz normale Antwort: Frag, wie das Wetter ist, wie lange der Stream schon läuft, was du letzte Woche gespielt hast, welche Chatbefehle du hast, was du vor einer Minute gefragt hast.
Nachfragen, bevor etwas passiert, das sich nicht rückgängig machen lässt
Standardmäßig an. Der Bot nennt das Ergebnis — „Vorhersage wird aufgelöst: ‚Wir gewinnen‘“ — und wartet auf ein „ja“. Er nennt absichtlich das Ergebnis und nicht die Aktion: Was du bestätigst, ist die Sache, die du nicht mehr zurücknehmen kannst.
Schalte es aus, und der Bot macht es einfach. Schneller, und es gibt kein Zurück.
Wo du siehst, was passiert ist
Die Kachel Stream: Stimme im Bedienfeld hält den Verlauf fest: deine Sätze und die Antworten des Bots, der Reihe nach. Die Farbe des Streifens links sagt, wie es ausgegangen ist — blau für eine Antwort, grün für etwas Erledigtes, gelb für eine Rückfrage, rot für eine Ablehnung mit dem Grund daneben.
Standardmäßig sagt der Bot die kurze Fassung laut — „Umfrage gestartet“ — und die Einzelheiten gehen in diesen Verlauf. Wenn du keinen zweiten Bildschirm zum Mitlesen hast, schalte auf der Seite Sprachsteuerung Gesamtes Ergebnis vorlesen ein.
Drei Schaltflächen in der Kopfzeile der Kachel:
- Mikrofon — wechselt zwischen *Taste gedrückt halten* und *immer*, dieselbe Einstellung wie auf der Erkennungsseite;
- Lautsprecher — Antworten vorlesen oder sie als Text im Verlauf stehen lassen;
- Ein/Aus — die äußerste: Der Bot wird still, die Erkennung stoppt und das Modell verlässt den Speicher. Szenarien, die von Spenden und Kanalpunkten ausgelöst werden, sind nicht betroffen — sie brauchten das Mikrofon nie. Es stoppen nur Szenarien, die ein gesprochener Satz ausgelöst hat.
Was es kostet
Sprachsteuerung ist eine kostenpflichtige Funktion. Die Hälfte, die zuhört, läuft auf deinem eigenen Rechner und erhöht die Rechnung nicht; die Hälfte, die dich versteht und handelt, ist die KI, und diese Hälfte bezahlst du.
- Ein Sprachbefehl sind zwei Anfragen an die KI, nicht eine: ein billiger Analyseschritt, der das Gehörte geraderückt und entscheidet, ob das Internet nötig ist, und die Antwort selbst. Die Karte jeder Aktion zeigt den Preis, der dir tatsächlich berechnet wird.
- Die Erkennung selbst wird nicht berechnet. Sie läuft auf deinem Rechner, ein offenes Mikrofon kostet also nichts, solange du den Bot nicht wirklich ansprichst.
- Eine Websuche kostet zehn Credits. Sie passiert nur, wenn die Frage Fakten aus dem Internet braucht, und nur wenn Websuche erlauben an ist.
Wenn es nicht funktioniert
Die App hört überhaupt nichts. Prüfe, ob das Modell heruntergeladen ist, und nutze dann Mikrofon prüfen — sag innerhalb von vier Sekunden einen Satz, und die App zeigt, was sie gehört hat. Zeigt sie nichts, erhöhe die Eingangsverstärkung oder senke die Spracherkennungsschwelle.
Der Bot antwortet auf jeden Satz. Das Mikrofon steht auf Immer und der Name ist leer. Gib ihm einen Namen oder wechsle auf Taste gedrückt halten.
Der Bot hört dich, tut aber nichts. Die Aktion ist auf der Seite Sprachsteuerung ausgeschaltet, oder die Plattform, die sie braucht, ist nicht verbunden — die Karte sagt, welche.
Er sagt „Ich habe nicht verstanden, welche Szene du meintest“. Der gehörte Name passt zu nichts, was verbunden ist. Szenennamen kommen aus OBS, Namen von Schaltflächen aus dem Bedienfeld; sag den Namen so, wie er dort steht.
Er antwortet über etwas anderes, obwohl er dich richtig gehört hat. Vor der Antwort repariert die App das Gehörte anhand der Namen, die sie kennt — Szenen, Geräte, Tasten —, und ein seltenes Wort von dir kann dabei durch einen davon ersetzt werden. Trag es unter Stimme → Spracherkennung ein, im Tab Namen, die es richtig verstehen soll: dieser Schritt liest die Liste ebenfalls, und ein Wort daraus wird nie ersetzt.
In der Liste steht „Zuvor gewähltes Mikrofon (nicht gefunden)“. Das Gerät ist nicht mehr im System — abgezogen, umbenannt oder von einem anderen Programm belegt. Die Erkennung verstummt deswegen nicht: Sie wechselt auf das Standardmikrofon des Systems. Drücke Mikrofone suchen, wähl das richtige aus und speichere.
Da steht „Die Erkennung ist nicht gestartet“. Die Engine ließ sich nicht laden, und das Mikrofon hat damit nichts zu tun — die Zeile darunter sagt, was das System gemeldet hat. Aktualisiere zuerst die App: Builds vor 0.14.2 gingen ohne eine der Windows-Laufzeitbibliotheken raus, und auf einem sauberen Windows startete die Erkennung überhaupt nicht. Bleibt die Meldung nach dem Update, schick das Log zusammen mit dieser Zeile an den Support.