TaxBERT est un modèle de langage spécialisé affiné sur des documents juridiques et fiscaux, construit sur l'architecture Legal-BERT développée par Chalkidis et ses collègues de l'Université d'Athènes. C'est le modèle open-source le plus spécialisé disponible pour les tâches de traitement du langage naturel liées à la fiscalité.
Le modèle a été entraîné sur un corpus de 12 Go de documents juridiques et fiscaux, y compris les directives européennes, les réglementations fiscales, les guides TVA et les documents de conformité fiscale des entreprises. Cette formation extensive sur des textes réglementaires structurés donne à TaxBERT une compréhension approfondie de la terminologie fiscale.
Pour les équipes de conformité fiscale, les cabinets comptables et les institutions financières gérant des obligations fiscales transfrontalières, TaxBERT offre un outil puissant pour automatiser la classification de documents et l'analyse de textes réglementaires. Sa licence Apache 2.0 permet un déploiement commercial gratuit, et son entraînement sur les matériels juridiques européens le rend particulièrement précieux pour les institutions financières européennes.