Marketing · écoute sociale
Moteur d'écoute des communautés : intentions d'achat et mentions de marque dans les groupes Telegram publics
Un moteur d'écoute qui analyse des communautés Telegram publiques, repère les intentions d'achat et les mentions de marque, puis les envoie aux commerciaux en fiches expliquées avec un projet de réponse, le LLM n'intervenant qu'au besoin.
- Secteur
- Marketing · écoute sociale
- Technologies
- Python 3.12 · Telethon · PostgreSQL + pgvector
Le défi
Une équipe marketing et commerciale voulait trouver, dans les communautés Telegram publiques, les personnes qui cherchent un produit comme le sien, et voir les mentions de sa marque au moment où elles apparaissent. Telegram complique la tâche de trois façons. Les comptes sont soumis à des limites de débit et pénalisés en cas de lecture trop agressive. Les messages regorgent de doublons, de transferts, de caractères d'apparence trompeuse et de langues mélangées. Et faire passer chaque message par un modèle de langage coûterait bien plus que ce que valent les leads.
La solution
Nous avons construit le moteur en Python sur une couche client Telegram avec un pool de comptes, des budgets d'opérations par compte et la gestion des temporisations imposées (flood-wait). Les nouvelles sources sont découvertes via les liens, les transferts et des catalogues web, puis passent par un entonnoir de qualification. Les messages sont normalisés, dédoublonnés à quatre niveaux et comparés avec un automate Aho–Corasick, avec une seconde passe sémantique sur pgvector. Un filtre croisant intention et domaine ne fait intervenir le modèle que si un message montre à la fois une intention d'achat et de la pertinence. La plupart des intentions sont reconnues avant ce stade par un lexique, la structure de la conversation et un petit classifieur local entraîné sur des étiquettes produites par le modèle.
Comment tout s'enchaîne
- 01 Découvrir les sources
- 02 Scanner les messages
- 03 Normaliser et dédoublonner
- 04 Filtre d'intention
- 05 Confirmation par LLM
- 06 Envoi de la fiche
Ce que nous avons livré
- Couche client Telegram avec pool de comptes, budgets d'opérations et gestion du flood-wait
- Découverte de sources via les liens, les transferts et des catalogues web, avec un entonnoir de qualification et un indicateur de saturation
- Normalisation des caractères d'apparence trompeuse et invisibles, détection de la langue et dédoublonnage à quatre niveaux avec SimHash
- Correspondance exacte avec un automate Aho–Corasick et des règles RE2 sûres, plus une recherche sémantique avec pgvector
- Cascade IA avec un filtre à deux axes, intention et domaine, maîtrise du budget et du rythme, et suivi des coûts par fournisseur
- Registre des mentions de marque avec leur tonalité
- Envoi via un bot Telegram : fiches expliquées, boutons de retour, codes d'accès à usage unique, rôles et piste d'audit
- Plus de 700 tests automatisés
Fonctionnalités
- Un classifieur d'intention local, entraîné sur des étiquettes produites par le modèle, limite les appels au modèle à une petite part des messages
- Couche fournisseurs pour Claude et Gemini, avec suivi des coûts
- Débit de correspondance mesuré par des benchmarks
- Contrats JSON Schema entre les étapes du pipeline
- Un service d'arrière-plan maintient le scanner en marche, lance une alerte quand il devient silencieux et le redémarre
Intégrations
- API client de Telegram (MTProto)
- Telegram Bot API
- API Anthropic Claude et Google Gemini
Technologies
Résultat
En pilote sur de vraies communautés depuis août 2026, le moteur fournit des fiches à l'équipe. La capacité du pool de comptes est la limite actuelle ; une version multi-tenant avec API constitue la phase suivante.
Comment garder les coûts du modèle sous contrôle ?
En faisant du modèle la dernière étape, pas la première. La recherche par mots-clés et la recherche sémantique réduisent le flux aux messages qui traitent du sujet. Un lexique, la forme de la conversation et un petit classifieur local décident ensuite si un message exprime une intention d’achat. Seuls les messages qui passent ces deux contrôles atteignent le modèle de langage, qui confirme l’intention et rédige un projet de réponse. Chaque appel au modèle est budgété et journalisé avec son coût : la dépense est connue avant la fin du mois.
Parlons de votre projet
Présentez-nous votre projet