Analyse de sentiment en français : deux approches comparées
« Comparaison d'embeddings entraînés sur mesure et d'un modèle Transformer pré-entraîné sur le français, sur une même tâche de classification. »
Le Processus de Développement
De la conception à la mise en production, chaque étape est primordiale.
Analyse & Conception
Compréhension des besoins métiers et élaboration de l'architecture.
Développement & Tests
Écriture d'un code propre et mise en place de tests unitaires.
Déploiement
Mise en ligne et monitoring de la solution pour assurer sa fiabilité.
Le français, pas l'anglais traduit
CamemBERT plutôt que BERT : un modèle entraîné sur de l'anglais traite mal les constructions françaises. Un choix qui compte pour tout projet francophone.
Technologies Utilisées
Pour classer un texte français, faut-il entraîner ses propres représentations ou partir d'un modèle déjà entraîné sur la langue ? Les deux approches sont mises en regard sur la même tâche, puis le modèle retenu est exposé par une API.
- CamemBERT — Transformer pré-entraîné sur le français
- Word2Vec (gensim) — embeddings entraînés sur le corpus
- PyTorch · Transformers · Scikit-learn
- API Flask exposée par tunnel ngrok
Impact du Projet
Le corpus est volontairement restreint : l'objectif était de comparer des méthodes, pas d'atteindre une performance absolue. Les scores obtenus ne se transposent donc pas à des données réelles, plus bruitées et souvent ironiques. Le prolongement naturel est de rejouer la comparaison sur un corpus annoté réel, où l'écart entre les deux approches devient significatif.
Étude de méthode
corpus réduit, conclusions sur la démarche
Découvrez ce projet
Ce projet est une vitrine de mes compétences en tant que développeur full-stack.