Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Pipecat dévoile PhoneLLM Alpha 1, un modèle ouvert pour agents vocaux dérivé de Nemotron

3 min de lecture · huggingface.co · 27 août 2026

D'après Fiche du modèle PhoneLLM Alpha 1 sur Hugging Face (Pipecat), relayé par X (@kwindla)

Pipecat dévoile PhoneLLM Alpha 1, un modèle ouvert pour agents vocaux dérivé de Nemotron

Image : générée (Gemini)

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • PhoneLLM Alpha 1 n'est pas entraîné de zéro : c'est un réglage fin à pleins paramètres du modèle NVIDIA Nemotron 3 Nano 30B-A3B, précise la fiche du modèle publiée par Pipecat sur Hugging Face.
  • Le nom même du dépôt (phonellm-alpha-1) et le titre de la fiche l'indiquent : il s'agit d'une version alpha, pas d'un modèle présenté comme stable pour la production.
  • Le pipeline déclaré sur Hugging Face est « text-generation » : PhoneLLM ne parle ni n'écoute lui-même, il joue le rôle du cerveau conversationnel dans une chaîne où d'autres modèles font la reconnaissance et la synthèse de la parole.
  • Sur 30 milliards de paramètres au total, seuls 3,5 milliards s'activent à chaque appel (architecture à mélange d'experts), ce qui explique la faible latence annoncée.
  • PhoneLLM est distribué sous licence BSD 2-Clause, une licence réellement permissive, sans restriction commerciale - une denrée plus rare qu'il n'y paraît chez les modèles dits « ouverts ».

Pourquoi ça compte

Beaucoup de modèles « raisonnants » répondent trop lentement pour une conversation téléphonique naturelle. Et Pipecat affirme avoir constaté, dans son propre travail de création d'agents vocaux, que plusieurs petits modèles peinent à réellement déclencher les bons outils (réserver, transférer un appel) plutôt que de simplement prétendre l'avoir fait. Pipecat cible directement ce compromis latence-fiabilité, un enjeu concret pour toute entreprise qui envisage d'automatiser un centre d'appels.

Chiffre-clé

Selon Pipecat (fiche du modèle, 27 août 2026), PhoneLLM répond en moins de 600 ms (95e centile, réseau compris) sur un GPU Nvidia B200, pour environ 0,0025 $ US la minute d'appel pour la seule composante LLM (hors reconnaissance et synthèse de la parole), contre environ 1 900 ms de premier jeton pour GPT 5.6 Terra en mode rapide. Chiffres du fabricant, non vérifiés de façon indépendante.

Citation

« PhoneLLM is a full-weights fine-tune of NVIDIA Nemotron Nano 30B. » Kwindla Hultman Kramer, créateur de Pipecat (@kwindla)

Action concrète

Les poids de PhoneLLM sont publics sur Hugging Face (dépôt pipecat-ai/phonellm-alpha-1) : quiconque évalue une solution d'agent vocal peut les essayer sur ses propres scénarios avant de les envisager en production, en gardant à l'esprit le statut alpha du modèle.

« Introducing PhoneLLM, an open model for voice agents. GPT 5.6 Terra performance on typical voice agent tasks at 1/3 the latency and 1/18 the cost. »

Fondée sur la source originale

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !