Plongement Multimodal
Le plongement multimodal est une technique qui génère des représentations vectorielles unifiées de données provenant de différentes modalités, telles que le texte, les images, l'audio et la vidéo, les projetant dans un espace sémantique partagé où des comparaisons de similarité cross-modales sont possibles. Contrairement aux modèles de plongement traditionnels qui ne traitent que le texte, les modèles de plongement multimodal sont entraînés sur des paires ou groupes de données de différentes modalités, apprenant à projeter du contenu sémantiquement similaire de différentes modalités vers des points proches dans l'espace de plongement. Cela permet de puissantes capacités de recherche cross-modale, telles que la recherche d'images en utilisant des descriptions textuelles, la recherche de texte qui décrit une image donnée, ou la recherche de documents sémantiquement similaires à un graphique ou diagramme. L'entraînement des modèles de plongement multimodal utilise typiquement des objectifs d'apprentissage contrastif, où le modèle apprend à maximiser la similarité entre des paires correspondantes de différentes modalités, comme une image et sa légende, tout en minimisant la similarité entre des paires non correspondantes. Le modèle de plongement multimodal le plus connu est CLIP, développé par OpenAI, qui apprend des plongements texte-image conjoints à partir de 400 millions de paires texte-image. L'architecture des modèles de plongement multimodal consiste typiquement en des encodeurs séparés pour chaque modalité, comme un vision transformer pour les images et un transformer pour le texte, avec une couche de projection qui projette les sorties des deux encodeurs dans un espace de plongement partagé. La qualité des plongements multimodaux est mesurée par les performances sur les tâches de récupération cross-modale, la classification zero-shot et la capacité à capturer des relations sémantiques fines à travers les modalités. Les plongements multimodaux sont de plus en plus importants car les applications d'IA s'étendent au-delà du texte pour inclure des images, des documents avec des graphiques et diagrammes intégrés, des vidéos et du contenu audio. Le défi clé du plongement multimodal est de garantir que l'espace de plongement partagé préserve les relations sémantiques à travers les modalités, afin que la description textuelle d'un concept financier soit proche de la représentation visuelle de ce concept, comme un graphique montrant la même tendance.
Dans les services financiers
Exemple concret
Une société de gestion d'actifs mondiale avec 800 milliards de dollars d'actifs sous gestion déploie un système de plongement multimodal pour alimenter la recherche cross-modale dans son référentiel de documents de recherche. Le référentiel de la société contient environ 1,5 million de documents, y compris des rapports de recherche en actions, des analyses de titres à revenu fixe, des commentaires macroéconomiques et des présentations de résultats trimestriels, tous contenant un mélange de texte, de graphiques, de tableaux et de diagrammes. La société indexe l'ensemble du référentiel en utilisant un modèle de plongement multimodal qui génère des plongements à 768 dimensions pour chaque segment de document, avec des plongements séparés mais alignés pour le texte et le contenu visuel. Un gestionnaire de portefeuille spécialisé dans le secteur de l'énergie se prépare pour une réunion du comité d'investissement et doit comprendre les tendances des dépenses d'investissement des grandes compagnies pétrolières et gazières au cours des cinq dernières années. Le gestionnaire de portefeuille fournit une requête textuelle: 'Montrez-moi les graphiques de tendance des dépenses d'investissement pour les grandes compagnies pétrolières et gazières, comparant les dépenses d'exploration et de production par rapport aux investissements dans les énergies renouvelables, de 2021 à 2025.' Le système de plongement multimodal calcule le plongement de cette requête et recherche parmi les plongements de tout le contenu visuel du référentiel, y compris les graphiques, diagrammes et tableaux. Le système récupère les graphiques pertinents de 47 documents différents, y compris des graphiques de présentations de résultats d'entreprises, de rapports de recherche en actions et de publications industrielles. Le système récupère également des sections de texte contenant des analyses pertinentes des tendances des dépenses d'investissement. La recherche, qui aurait pris des heures en utilisant la recherche par mots-clés traditionnelle ou l'examen manuel, est complétée en moins de 3 secondes. Le gestionnaire de portefeuille identifie une tendance clé: tandis que les grandes compagnies pétrolières européennes ont significativement augmenté leurs dépenses d'investissement dans les énergies renouvelables en pourcentage du total des dépenses, les entreprises américaines ont maintenu un accent plus fort sur les dépenses traditionnelles d'exploration et de production.
Pourquoi c'est important en Finance
Le plongement multimodal représente une avancée significative dans la capacité des systèmes d'IA à comprendre et rechercher à travers les divers types de contenu qui caractérisent les documents et communications financiers. Les professionnels de la finance travaillent avec un mélange riche de texte, de graphiques, de diagrammes, de tableaux, d'images et de plus en plus de contenu vidéo et audio, et la capacité de rechercher et d'analyser à travers toutes ces modalités à partir d'une seule interface transforme l'efficacité et l'efficience de la recherche, de l'analyse et de la prise de décision financières. L'approche traditionnelle de recherche uniquement textuelle manque une vaste quantité d'informations intégrées dans les graphiques, diagrammes et images, qui contiennent souvent les informations et tendances les plus importantes dans les documents financiers. Le plongement multimodal comble cet écart, rendant le contenu visuel aussi recherchable et analysable que le texte. L'impact sur la recherche financière est particulièrement significatif. Les analystes et gestionnaires de portefeuille passent une partie substantielle de leur temps à rechercher des informations pertinentes dans les documents, et une grande partie de ces informations est sous forme visuelle. En permettant la recherche en langage naturel à travers toutes les modalités, le plongement multimodal réduit le temps passé sur la découverte d'informations et augmente la profondeur et la largeur de la recherche. La technologie permet également de nouvelles capacités d'analyse qui étaient auparavant impraticables. Par exemple, les analystes peuvent identifier des modèles visuels à travers des milliers de graphiques, comme la prévalence de certains types de graphiques, l'utilisation de représentations visuelles particulières, ou la corrélation entre les styles de présentation visuelle et les performances financières. Pour la conformité et la gestion des risques, le plongement multimodal permet la surveillance du contenu visuel dans les communications, aidant à identifier les graphiques potentiellement trompeurs, les modèles visuels inhabituels ou l'utilisation non autorisée de contenu visuel propriétaire. La capacité de rechercher à travers les modalités soutient également une due diligence plus efficace, où les analystes peuvent rapidement trouver et comparer des représentations visuelles de données financières à travers différentes entreprises, secteurs et périodes.
Termes associés
Explorer dans Finatune
Questions fréquentes
Qu'est-ce que le plongement multimodal en finance?
Le plongement multimodal génère des représentations vectorielles unifiées de données de différentes modalités, les projetant dans un espace sémantique partagé. En finance, cela permet de rechercher des graphiques en utilisant des descriptions textuelles, de trouver du texte décrivant un graphique donné, ou de rechercher des documents par similarité de contenu visuel.
Comment les plongements multimodaux sont-ils utilisés pour la recherche de documents financiers?
Les plongements multimodaux permettent aux analystes de rechercher dans les documents financiers en utilisant des requêtes en langage naturel qui récupèrent à la fois du texte et du contenu visuel. Un analyste peut demander 'Montrez-moi les graphiques de croissance des revenus' et le système trouve les graphiques pertinents dans les rapports.
Quelles bases de données vectorielles supportent les plongements multimodaux pour la finance?
Weaviate et Qdrant sont des bases de données vectorielles avec support natif des plongements multimodaux. Elles supportent plusieurs modèles de plongement et métriques de similarité, permettant aux institutions financières de construire des systèmes de recherche cross-modale.