🧪 Neue Tutorials in Arbeit — vom Roboterarm bis zum Sensor
Zum Inhalt springen

Kapitel 11: ESP-Claw-Sprachsteuerung

Im Shop kaufen

Ziel dieses Kapitels: Die LED-Lichteffekte, den KI-Moduswechsel und die Foto-Visionsanalyse des NanoCam direkt per Sprache steuern.

Über dieses Kapitel

Wenn das Gerät auf ai_mode:7 umgestellt wird, wechselt der NanoCam in den ESP-Claw-Modus. Er verwendet dieselbe Firmware (nanocam_espclaw/) wie XiaoZhi AI (ai_mode:6); der einzige Unterschied: Der ESP-Claw-Modus registriert zusätzlich zu den Sprachdialogfunktionen 5 Hardware-Steuerungstools.

MerkmalXiaoZhi AI (mode 6)ESP-Claw (mode 7)
Sprachdialog✅ ASR→LLM→TTS✅ Dieselbe Sprachpipeline
LED-Steuerung✅ Sprachliche Farbwahl / Ein-/Ausschalten
KI-Moduswechsel✅ Sprachliche Umschaltung
Foto + KI-Visionsanalyse✅ Foto aufnehmen und multimodale KI zur Bildanalyse aufrufen

Funktionsprinzip

Der ESP-Claw-Modus registriert über RegisterMcpTools() zusätzlich zur Sprachpipeline 5 NanoCam-spezifische Tools:

Plain
Nutzer-Sprachbefehl "Stell das Licht auf Blau"
  → ASR-Spracherkennung (Cloud)
  → LLM versteht die Absicht → Aufruf self.led.set_color({"r":0, "g":0, "b":255})
  → NanoCam WS2812 LED wird blau
  → TTS: "Okay, das Licht ist jetzt blau"

Schritte

11.1 Firmware flashen

ESP-Claw verwendet das eigenständige Firmware-Projekt nanocam_espclaw/:

Bash
cd nanocam_espclaw
idf.py set-target esp32s3
idf.py build
idf.py -p COMx flash

11.2 Modus wechseln

Stellen Sie nach dem Start den ESP-Claw-Modus ein:

Plain
ai_mode:7

Das Gerät startet automatisch neu und wechselt in den Modus. Mit ai_mode:6 können Sie zum XiaoZhi-AI-Modus zurückkehren.

11.3 Beispiele für die Sprachsteuerung

Sagen Sie nach dem Aktivierungswort direkt, was Sie möchten:

Plain
💬 "Mach das Licht an"            → WS2812 leuchtet weiß
💬 "Stell das Licht auf Blau"     → LED wird blau
💬 "Mach das Licht aus"           → LED aus
💬 "Wechsle in den Gesichtsdetektionsmodus" → ai_mode:2 in NVS speichern + Neustart
💬 "Schau, was hier ist"          → Foto + multimodale KI-Analyse
💬 "Ist eine Tasse vor mir"       → Die multimodale KI erkennt die Szene

11.4 Foto + KI-Visionsanalyse

Wenn der Nutzer „Schau, ..." sagt, erfasst die Firmware ein VGA-RGB565-Bild, komprimiert es als JPEG und sendet es an die serverseitig konfigurierte multimodale API zur Analyse; das Ergebnis wird per TTS-Sprachausgabe ausgegeben.

URL und Token der multimodalen API werden vom Server während des Verbindungs-Handshakes automatisch übermittelt; es müssen keine Konfigurationsbefehle manuell über die serielle Schnittstelle eingegeben werden.

5 NanoCam-spezifische Tools

Tool-NameFunktionParameter
self.led.set_colorWS2812-RGB-LED einstellen (GPIO18)r,g,b: 0-255
self.led.turn_offLED ausschaltenKeine
self.camera.set_ai_modeKI-Modus wechseln (NVS-Speicherung + Neustart)mode: 0-7
self.camera.inspect_imageFoto + multimodale LLM-Visionsanalyseprompt: Problembeschreibung
self.get_device_infoGeräteinformationen als JSONKeine

Konfigurationsdateien

InhaltPfad
MCP-Tool-Registrierungnanocam_espclaw/main/boards/nanocam/nanocam_board.cc
Vision-Sendelogiknanocam_espclaw/main/boards/common/esp32_camera.cc
SDK-Standardkonfigurationnanocam_espclaw/sdkconfig.defaults

Die ESP-Claw-Firmware ist ein eigenständiges Projekt und teilt keinen Code mit nanocam_vision. Beide Firmwares müssen getrennt kompiliert und geflasht werden.

Wie Sie wählen

Ihr BedarfEmpfohlener Modus
Nur Sprachchat und Frage-AntwortModus 6 (XiaoZhi)
Sprachsteuerung der LEDModus 7 (ESP-Claw)
Foto + KI-„Blick" auf die SzeneModus 7 (ESP-Claw)
Sprachliches Umschalten des KI-ErkennungsmodusModus 7 (ESP-Claw)

Die vollständige Nutzung von ESP-Claw (Serverkonfiguration, Entwicklung eigener MCP-Tools usw.) wird noch erforscht; die Dokumentation wird mit dem Fortschritt der Untersuchungen laufend aktualisiert.

Damit ist die 11-teilige Tutorial-Reihe vollständig abgeschlossen. Die vollständigen seriellen Befehle (z. B. der ai_mode-Moduswechsel) finden Sie im Handbuch zum seriellen Protokoll.