En bref. Les modèles de langage généralistes (BERT, GPT) comprennent mal le vocabulaire, les conventions et les nuances du domaine financier. Depuis 2019, une famille de modèles spécialisés, de FinBERT à BloombergGPT en passant par FinGPT et FinMA, a émergé pour combler cet écart. Cet article propose une revue comparative pédagogique de ces modèles : leurs architectures, leurs corpus d'entraînement, leurs performances et leurs limites.

Pourquoi des modèles de langage « finance » ?

Le traitement automatique du langage naturel (TALN, ou NLP) a été bouleversé par l'architecture Transformer introduite par Vaswani et al. (2017)1, puis par les modèles pré-entraînés comme BERT (Devlin et al., 2019)2 et la famille GPT (Brown et al., 2020)3. Ces modèles, entraînés sur des corpus généralistes (Wikipédia, Common Crawl, livres), excellent sur des tâches transversales.

Mais le langage financier présente des caractéristiques qui mettent en difficulté ces modèles généralistes :

  • Un vocabulaire spécialisé et polysémique. Des termes comme liability, bull, bear, short, maturité, provision ou exposition ont un sens technique éloigné de leur usage courant.
  • Une sémantique du sentiment inversée. En finance, « la dette augmente » n'est pas neutre : le contexte détermine si c'est positif ou négatif. Malo et al. (2014) ont formalisé cette difficulté avec le jeu de données Financial PhraseBank4.
  • Des documents longs et structurés : rapports annuels, prospectus, communiqués de résultats, transcriptions d'earnings calls.
  • Des enjeux de fiabilité élevés : une erreur d'interprétation peut avoir des conséquences réglementaires ou financières directes.

L'idée directrice est celle de l'adaptation au domaine (domain adaptation). Gururangan et al. (2020), dans « Don't Stop Pretraining »5, ont montré empiriquement qu'un pré-entraînement continué sur un corpus de domaine (domain-adaptive pretraining) améliore significativement les performances en aval. Les modèles financiers présentés ci-dessous sont autant d'illustrations de ce principe.

1. FinBERT : la première vague (2019–2020)

Le nom « FinBERT » recouvre en réalité plusieurs modèles distincts publiés indépendamment, ce qui est une source fréquente de confusion.

1.1 FinBERT (Araci, 2019)

La première version, proposée par Dogu Araci6, part de BERT et applique un pré-entraînement continué sur le corpus financier TRC2 (Reuters), suivi d'un fine-tuning sur le Financial PhraseBank pour l'analyse de sentiment. Résultat : des gains nets par rapport à BERT généraliste sur la classification de sentiment financier. C'est la version la plus citée et la plus utilisée en pratique.

1.2 FinBERT (Yang et al., 2020)

Yang, Uy et Huang7 proposent une variante entraînée sur un corpus financier plus large (rapports 10-K/10-Q, earnings call transcripts, analystes), avec évaluation sur plusieurs tâches. Cette version insiste sur la constitution d'un corpus financier de grande échelle.

1.3 FinBERT (Liu et al., 2020)

Liu et al.8 présentent, à IJCAI 2020, un « FinBERT » pré-entraîné de bout en bout sur des textes financiers avec des tâches d'auto-supervision adaptées au domaine, pour le financial text mining.

À retenir. « FinBERT » n'est pas un modèle mais une famille. Il faut toujours préciser l'auteur et l'année. Point important souvent négligé : ces modèles sont des encodeurs de type BERT, conçus pour la classification et l'extraction ; et non, nativement, pour la génération de texte ni pour la recherche sémantique (retrieval), qui nécessitent des adaptations supplémentaires.

2. Les benchmarks : FLUE, FLANG et l'évaluation du domaine

Comparer des modèles nécessite des jeux d'évaluation standardisés. Shah et al. (2022) ont introduit FLUE (Financial Language Understanding Evaluation), un ensemble de tâches de référence, ainsi que le modèle FLANG9. FLUE regroupe des tâches variées : analyse de sentiment, classification de titres, détection d'entités nommées financières, et réponses à des questions structurées.

Ces benchmarks jouent en finance le rôle que GLUE10 joue pour le NLP généraliste : ils permettent des comparaisons reproductibles et objectives entre modèles.

3. BloombergGPT : le passage à l'échelle générative (2023)

Avec BloombergGPT (Wu et al., 2023)11, le paradigme change d'échelle. Il s'agit d'un modèle génératif (decoder-only) de 50 milliards de paramètres, entraîné sur un corpus mixte d'environ 700 milliards de tokens : ~363 milliards issus de données financières propriétaires de Bloomberg (« FinPile ») et ~345 milliards de données généralistes publiques.

Points clés :

  • Approche hybride : mélanger données financières et généralistes préserve les capacités transversales tout en spécialisant le modèle. C'est une illustration à grande échelle du principe d'adaptation au domaine.
  • Performances : BloombergGPT surpasse des modèles généralistes de taille comparable sur les tâches financières, tout en restant compétitif sur les benchmarks généralistes.
  • Limite majeure : le modèle et ses données sont propriétaires et non ouverts, ce qui limite sa reproductibilité et son adoption par la communauté.

BloombergGPT a marqué un tournant : il a démontré qu'un large language model dédié à la finance apportait une valeur mesurable, ouvrant la voie à des alternatives ouvertes.

4. FinGPT et FinMA : la réponse open source (2023)

Face au caractère fermé de BloombergGPT, plusieurs initiatives open source ont vu le jour.

4.1 FinGPT

FinGPT (Yang, Liu et Wang, 2023)12 adopte une philosophie différente : plutôt que de ré-entraîner un modèle géant depuis zéro (coûteux et difficilement reproductible), il s'appuie sur des LLM ouverts (comme LLaMA13) et les adapte via des techniques de fine-tuning efficaces telles que LoRA (Low-Rank Adaptation, Hu et al., 2021)14. L'accent est mis sur des pipelines de données à jour et un coût d'adaptation réduit.

4.2 PIXIU / FinMA

Le projet PIXIU (Xie et al., 2023)15 propose le modèle FinMA, accompagné d'un jeu de données d'instructions financières et d'un benchmark d'évaluation (FLARE). L'objectif est de fournir un écosystème ouvert et reproductible : modèle, données d'instruction et protocole d'évaluation.

Ces travaux illustrent une tendance de fond : l'adaptation légère (instruction-tuning, LoRA) plutôt que le pré-entraînement massif, pour démocratiser l'accès aux modèles financiers.

5. Faut-il un modèle spécialisé ? Le débat GPT-5, Claude vs. modèles dédiés

L'arrivée de LLM généralistes très puissants (GPT-5, Claude, etc.) a relancé une question légitime : un modèle spécialisé reste-t-il nécessaire ?

Plusieurs études, dont celle de Li et al. (2023)16, évaluent les LLM généralistes sur des tâches d'analyse de texte financier. Les conclusions convergent vers une réponse nuancée :

  • Les grands modèles généralistes obtiennent de bonnes performances en zero-shot sur des tâches simples (sentiment, classification).
  • Mais les modèles spécialisés ou finement adaptés conservent un avantage sur les tâches techniques, la terminologie fine et surtout le coût d'inférence et la maîtrise du déploiement (données sensibles, latence, souveraineté).

Le choix dépend donc du contexte : volume, sensibilité des données, contraintes de coût et de latence, langue cible.

Tableau comparatif

ModèleAnnéeTypeTailleDonnéesOuvert ?Usage principal
FinBERT (Araci)2019Encodeur (BERT)~110 MReuters TRC2 + PhraseBankOuiSentiment financier
FinBERT (Yang et al.)2020Encodeur (BERT)~110 M10-K/10-Q, calls, analystesOuiCompréhension financière
FinBERT (Liu et al.)2020Encodeur (BERT)~110 MCorpus financier dédiéPartielText mining financier
FLANG2022Encodeur (ELECTRA/BERT)~110 MCorpus + benchmark FLUEOuiÉvaluation multi-tâches
BloombergGPT2023Décodeur (génératif)50 MdFinPile (~363 Md tok.) + webNonGénération, tâches finance
FinGPT2023Décodeur + LoRAVariable (base LLaMA)Données financières à jourOuiAdaptation légère
FinMA / PIXIU2023Décodeur (instruction-tuné)7–30 MdInstructions financièresOuiÉcosystème ouvert + benchmark

Les tailles sont indicatives et dépendent des variantes publiées.

Comment choisir : critères pratiques

Pour un praticien, le choix d'un modèle financier se réduit rarement à « le plus gros » ou « le plus récent ». Quelques critères déterminants :

  1. Nature de la tâche. Classification/extraction → un encodeur type FinBERT suffit souvent et coûte bien moins cher. Génération/synthèse/raisonnement → un modèle génératif est nécessaire.
  2. Langue. La plupart de ces modèles sont anglophones. Pour le français ou d'autres langues, il faut se tourner vers des modèles multilingues ou envisager une adaptation dédiée, un enjeu majeur et encore sous-exploré dans la recherche.
  3. Ouverture et souveraineté. Un modèle ouvert autorise le déploiement sur infrastructure maîtrisée, essentiel pour des données financières sensibles.
  4. Coût d'inférence et latence. Un modèle de 50 milliards de paramètres a un coût d'exploitation sans commune mesure avec un encodeur de 110 millions.
  5. Actualité des données. Un modèle figé se périme vite dans un domaine où l'information évolue quotidiennement, d'où l'intérêt des approches d'adaptation continue.

Conclusion

En moins de cinq ans, les modèles de langage financiers sont passés de FinBERT, un encodeur spécialisé pour l'analyse de sentiment, à des systèmes génératifs à grande échelle comme BloombergGPT, puis à un mouvement d'ouverture porté par FinGPT et FinMA. Deux enseignements se dégagent :

  • L'adaptation au domaine fonctionne : spécialiser un modèle sur des données financières apporte un gain mesurable, conformément au principe du domain-adaptive pretraining.
  • Il n'existe pas de modèle universellement supérieur : le bon choix dépend de la tâche, de la langue, du budget et des contraintes de déploiement.

Les prochains défis portent sur le multilinguisme (au-delà de l'anglais), l'adaptation continue aux données récentes, et l'évaluation de la fiabilité dans des contextes à fort enjeu. Autant de sujets qui feront l'objet de prochains articles.

Références

Footnotes

  1. Vaswani, A., et al. (2017). Attention Is All You Need. NeurIPS. arXiv:1706.03762

  2. Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL-HLT. arXiv:1810.04805

  3. Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS. arXiv:2005.14165

  4. Malo, P., Sinha, A., Korhonen, P., Wallenius, J., & Takala, P. (2014). Good debt or bad debt: Detecting semantic orientations in economic texts. Journal of the Association for Information Science and Technology, 65(4), 782–796. arXiv:1307.5336

  5. Gururangan, S., et al. (2020). Don't Stop Pretraining: Adapt Language Models to Domains and Tasks. ACL. arXiv:2004.10964

  6. Araci, D. (2019). FinBERT: Financial Sentiment Analysis with Pre-trained Language Models. arXiv:1908.10063

  7. Yang, Y., Uy, M. C. S., & Huang, A. (2020). FinBERT: A Pretrained Language Model for Financial Communications. arXiv:2006.08097

  8. Liu, Z., Huang, D., Huang, K., Li, Z., & Zhao, J. (2020). FinBERT: A Pre-trained Financial Language Representation Model for Financial Text Mining. IJCAI.

  9. Shah, R. S., et al. (2022). When FLUE Meets FLANG: Benchmarks and Large Pretrained Language Model for Financial Domain. EMNLP. arXiv:2211.00083

  10. Wang, A., et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. ICLR Workshop. arXiv:1804.07461

  11. Wu, S., et al. (2023). BloombergGPT: A Large Language Model for Finance. arXiv:2303.17564

  12. Yang, H., Liu, X.-Y., & Wang, C. D. (2023). FinGPT: Open-Source Financial Large Language Models. arXiv:2306.06031

  13. Touvron, H., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971

  14. Hu, E. J., et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685

  15. Xie, Q., Han, W., Zhang, X., Lai, Y., Peng, M., Lopez-Lira, A., & Huang, J. (2023). PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance. NeurIPS Datasets and Benchmarks. arXiv:2306.05443

  16. Li, X., Zhu, X., Ma, Z., Liu, X., & Shah, S. (2023). Are ChatGPT and GPT-4 General-Purpose Solvers for Financial Text Analytics? A Study on Several Typical Tasks. arXiv:2305.05862