Mode vocal Hermes en CLI : quand parler à son agent est plus utile que taper
Ce que le mode vocal Hermes couvre (et ce qu’il ne couvre pas)
La documentation officielle liste trois surfaces vocales. Pas une de plus.
D’abord, le mode vocal interactif en CLI. Tu actives /voice on dans ta session terminal, tu appuies sur Ctrl+B pour enregistrer, et l’agent détecte automatiquement quand tu as fini de parler. Il te répond en voix, phrase par phrase, pendant que le texte se génère.
Ensuite, la réponse vocale automatique sur Telegram et Discord. Quand le gateway est configuré, l’agent peut envoyer un message audio avec chaque réponse texte. Sur Telegram, ça arrive comme une bulle vocale native. Sur Discord, pareil.
Le vrai sujet n’est pas d’ajouter un agent de plus.
Si tu veux construire un système d’agents utile, il te faut surtout une structure claire, de bons arbitrages et des retours terrain. C’est exactement ce qu’on partage dans Kavyro.
Arbitrages utiles
Questions réelles
Accès gratuit
Tu arrives avec ton sujet, tu repars avec plus de clarté.
Enfin, les canaux vocaux Discord. Le bot rejoint un canal vocal, écoute les utilisateurs qui parlent, transcrit, passe la transcription à l’agent, et répond en voix dans le canal. C’est la surface la plus immersive, mais aussi la plus exigeante en configuration.
Ce qui n’est pas couvert : pas de mode vocal sur WhatsApp, Signal, SMS, ou n’importe quelle autre plateforme non listée. La documentation est claire sur ce point, et le contrat factuel C14 interdit de promettre une fonction vocale ailleurs.
Le mode vocal en CLI : comment ça marche
La séquence est simple. Tu lances hermes pour démarrer une session interactive. Tu tapes /voice on. À partir de là, Ctrl+B lance un enregistrement.
L’agent utilise une détection de silence en deux étapes. D’abord, il repère le début de la parole. Ensuite, il attend une pause suffisante pour considérer que tu as fini. Si aucun son n’est détecté pendant 15 secondes, l’enregistrement s’arrête automatiquement.
La réponse arrive en streaming : le TTS lit chaque phrase dès qu’elle est générée. Tu n’attends pas la fin du texte complet pour commencer à entendre la réponse.
Un filtre anti-hallucination est intégré. Whisper produit parfois du texte fantôme à partir du silence ou du bruit de fond. Hermes bloque ces artefacts avec une liste de 26 phrases connues et un pattern regex.
Les prérequis avant de l’activer
Avant de taper /voice on, vérifie que tu as ce qu’il faut.
| Composant | Obligatoire ? | Installation |
|---|---|---|
| PortAudio | Oui (CLI) | sudo apt install portaudio19-dev |
| ffmpeg | Oui (toutes surfaces) | sudo apt install ffmpeg |
| Paquet Python [voice] | Oui (CLI) | uv pip install -e ".[voice]" |
| faster-whisper | Recommandé | pip install faster-whisper |
| Opus | Discord VC seulement | sudo apt install libopus0 |
| Paquet Python [messaging] | Telegram/Discord | uv pip install -e ".[messaging]" |
Pour la synthèse vocale, Edge TTS et NeuTTS fonctionnent sans aucune clé API. C’est le chemin le plus simple pour démarrer. ElevenLabs donne une meilleure qualité mais nécessite une clé payante.
Pour la reconnaissance vocale, faster-whisper est le choix recommandé : local, gratuit, et le modèle base (~150 Mo) se télécharge automatiquement au premier usage. Groq Whisper est une alternative cloud rapide avec un tier gratuit.
Ce qui se passe vraiment pendant une session vocale
Le mode vocal ne transforme pas Hermes en assistant conversationnel permanent. C’est un mode d’interaction parmi d’autres, avec des contraintes réelles.
D’abord, le bruit de fond. La détection de silence fonctionne bien dans un environnement calme, mais un open space ou une pièce avec de la musique peut déclencher des enregistrements intempestifs ou couper ta phrase trop tôt. Les seuils sont configurables dans config.yaml (silence_threshold, silence_duration).
Ensuite, la latence. Même avec Groq Whisper (~0.5s), il y a un délai entre la fin de ta phrase et le début de la réponse. C’est acceptable pour une question-réponse, moins pour un dialogue rapide.
Enfin, le streaming TTS est utile mais pas parfait. L’agent lit phrase par phrase, ce qui donne un rythme parfois haché. Ce n’est pas une conversation naturelle, c’est une lecture vocale de la réponse générée.
Les cas où le vocal est plus utile que le clavier
Le mode vocal n’est pas un gadget. Il a des cas d’usage précis où il fait gagner du temps.
Quand tu as une question simple et que tu n’es pas devant ton clavier. « Quel est le statut du cron de backup ? » ou « Résume les 3 derniers tickets GitHub ». Une phrase, une réponse vocale, et tu continues ce que tu faisais.
Quand tu veux dicter une idée sans t’interrompre. Tu es en train de lire un article, une idée te vient pour un projet. Ctrl+B, tu la dictes, l’agent la note. Pas besoin de changer de fenêtre.
Quand tu testes une configuration et que tu veux rester en contexte. Tu es dans le terminal, tu actives le vocal, tu poses une question sur l’erreur que tu viens de voir. L’agent a le contexte de la session et répond en conséquence.
Le mode vocal n’est pas fait pour les longues sessions de brainstorming ou les instructions complexes. Pour ça, le clavier reste plus précis.
Les limites à connaître avant de s’embarquer
Le mode vocal CLI ne fonctionne pas dans Docker sans configuration supplémentaire. Le conteneur n’a pas accès au micro de l’hôte par défaut. La documentation mentionne un bridge audio PulseAudio/PipeWire pour Linux desktop, mais ce n’est pas plug-and-play.
Les canaux vocaux Discord demandent des permissions supplémentaires sur le bot (Connect, Speak, Use Voice Activity) et une réinvitation avec les permissions mises à jour. Ce n’est pas compliqué, mais c’est une étape de configuration en plus.
La qualité de la reconnaissance dépend du modèle STT choisi. faster-whisper base est rapide mais moins précis que large-v3. Groq est très rapide mais dépend d’une connexion internet. Il n’y a pas de solution parfaite, seulement des compromis.
Le mode vocal ne remplace pas une bonne session de debugging au clavier. Il est utile pour les interactions courtes et les questions ponctuelles. Pour un travail de fond, le terminal classique reste l’outil principal.
Si tu veux évaluer si le mode vocal a sa place dans ta routine, le mieux est de l’activer sur un cas simple. Installe faster-whisper, active /voice on, et teste avec une question que tu poses déjà régulièrement à ton agent. Si ça te fait gagner du temps, garde-le. Sinon, désactive-le. C’est un outil, pas une obligation.
Tu peux faire une demande d’accès à la formation Hermes Agent sur kavyro.com pour voir comment intégrer le mode vocal dans une routine solopreneur complète.