Aller au contenu
Iknow

De 75 gigaoctets de littérature scientifique à un modèle de catégorisation réutilisable : une preuve de concept de recherche d'entreprise.

Entreprise de biotechnologie spécialisée dans les thérapies humaines · Pharmacie et biotechnologie

Mesurer la précision de la classification automatique sur trois sources de données fédérales pour une société de biotechnologie mondiale

Résumé exécutif

La Société R, l'une des premières entreprises de biotechnologie au monde, souhaitait améliorer sa capacité de recherche d'entreprise, la classification automatique — l'analyse automatique du contenu des documents et l'attribution de catégories et de mots-clés — figurant parmi ses principales exigences produit. La Société R voulait comparer les résultats de classification automatique des produits de recherche d'entreprise qu'elle envisageait avec ceux de l'un des principaux produits d'analyse de texte, mais ne disposait pas de l'expertise interne pour mener cette évaluation. Iknow a été chargée de réaliser l'évaluation, retenue pour sa connaissance technique approfondie et son expérience de nombreux produits de premier plan en recherche d'entreprise et en analyse de texte.

Iknow a choisi la SAP BusinessObjects Text Analysis Suite pour ses capacités supérieures d'extraction d'entités et de catégorisation, et a analysé plus de 50 000 documents scientifiques et techniques issus du Defense Technical Information Center, du département de l'Énergie des États-Unis et de la base de données PubMed de la National Library of Medicine, soit plus de 75 gigaoctets de données d'entrée. À l'aide de SAP BusinessObjects Text Analysis XI 3.0, de sa base de données embarquée Oracle XE et des outils Categorizer et ThingFinder Workbench, Iknow a réalisé 15 analyses distinctes, dont des tâches de création de taxonomies et de classification automatique, classant le contenu à la fois dans la taxonomie PubMed et dans une taxonomie propriétaire de la Société R avec une exactitude supérieure à 95 pour cent, tout en générant un ensemble réutilisable de règles de catégorisation. La Société R a procédé à l'achat éclairé d'un nouveau produit de recherche d'entreprise sur la base de l'analyse d'Iknow, et Iknow a en outre recommandé d'intégrer un produit d'analyse de texte à cette plateforme pour bâtir un processus automatisé de bout en bout d'acquisition, de balisage et d'indexation du contenu.

Contexte et historique

À propos du client

La Société R est l'une des plus grandes entreprises de biotechnologie indépendantes au monde. Son organisation de recherche et développement dépend de la capacité de ses scientifiques à retrouver de manière fiable les travaux antérieurs, et à s'appuyer sur eux, au sein d'un corpus vaste et en croissance constante de littérature scientifique et technique.

Contexte sectoriel

Pour une entreprise de biotechnologie à forte intensité de recherche, la qualité de la recherche d'entreprise dépend largement de la façon dont le contenu scientifique et technique est balisé et catégorisé, car les chercheurs doivent retrouver de manière fiable les travaux antérieurs, la veille concurrentielle et la documentation technique dans un corpus immense et croissant. Vers 2010, la classification automatique était devenue un critère d'évaluation standard des plateformes de recherche d'entreprise, mais les affirmations des éditeurs sur l'exactitude de la classification variaient fortement et étaient difficiles à vérifier de manière indépendante. Confronter les produits de recherche d'entreprise à un moteur d'analyse de texte éprouvé et indépendant donnait à la Société R un moyen objectif de valider la performance des éditeurs avant de s'engager dans un achat. Tester sur de grands jeux de données scientifiques et techniques publics et faisant autorité, comme PubMed, DTIC et DOE, conférait une réelle crédibilité à l'évaluation, puisqu'il s'agissait exactement du type de contenu sur lequel s'appuyaient les propres chercheurs de la Société R.

Situation de départ

La Société R souhaitait améliorer ses capacités de recherche d'entreprise, la classification automatique figurant parmi ses principales exigences produit, et comparer les résultats de classification automatique des produits de recherche d'entreprise envisagés avec ceux de l'un des principaux produits d'analyse de texte. Ne disposant pas en interne de l'expertise nécessaire pour mener cette évaluation, elle a demandé à Iknow de la réaliser.

Problème / défi

  • Aucun moyen objectif de valider les affirmations d'exactitude des éditeurs. La Société R devait évaluer la classification automatique comme exigence majeure de son achat de recherche d'entreprise, mais n'avait aucun moyen objectif de valider les affirmations des éditeurs.
  • Aucune expertise interne pour l'évaluation. La Société R ne disposait pas de l'expertise interne pour évaluer de manière indépendante la performance de classification automatique des solutions de recherche d'entreprise.
  • Aucun corpus de test représentatif à grande échelle. Toute évaluation comparative devait être menée sur un contenu scientifique et technique véritablement vaste et représentatif, et non sur un échantillon restreint ou artificiel.
  • Aucune méthodologie réutilisable au-delà d'un test unique. La Société R avait besoin que la méthodologie de catégorisation obtenue soit réutilisable, et non une analyse ponctuelle.

Objectifs du projet

  • Évaluer de manière indépendante l'exactitude de la classification automatique des produits de recherche d'entreprise envisagés par la Société R.
  • Mener cette évaluation sur un corpus vaste et représentatif de documents scientifiques et techniques.
  • Classer le contenu à la fois dans une taxonomie publique établie et dans une taxonomie propriétaire de la Société R.
  • Livrer une méthodologie de catégorisation et un ensemble de règles réutilisables, et non une analyse ponctuelle.

L’approche d’Iknow

Comment Iknow a structuré la mission

Iknow a structuré la mission autour du choix d'une plateforme de référence indépendante, de la constitution d'un vaste jeu de données représentatif, de l'exécution de multiples analyses de taxonomie et de classification, et de la validation de l'exactitude et de la réutilisabilité — conformément à la méthodologie de preuve de concept en IA d'Iknow, qui valide une approche technologique par des preuves réelles avant toute décision d'achat.

Activités et décisions clés

  • Choix de la plateforme de référence. Iknow a choisi la SAP BusinessObjects Text Analysis Suite pour analyser le contenu de la Société R en raison de ses capacités supérieures d'extraction d'entités et de catégorisation.
  • Jeu de données représentatif à grande échelle. Iknow a reçu plus de 50 000 documents scientifiques et techniques provenant de DTIC, du DOE et de PubMed, chaque jeu de données comprenant une taxonomie propre à la source, des documents en texte intégral et des résumés, pour un volume total de données d'entrée dépassant 75 gigaoctets.
  • Configuration de la plateforme. Iknow a réalisé le traitement et l'analyse avec SAP BusinessObjects Text Analysis XI 3.0, la base de données embarquée Oracle XE et les outils Categorizer Workbench et ThingFinder Workbench.
  • Taxonomie et extraction d'entités. Iknow a utilisé l'algorithme d'apprentissage par l'exemple et le moteur à base de règles du Categorizer Workbench pour créer et maintenir les taxonomies, et le ThingFinder Workbench pour identifier et extraire automatiquement les entités du texte.
  • Évaluation par analyses multiples. Iknow a réalisé 15 analyses distinctes sur le jeu de plus de 50 000 documents, dont diverses tâches de création de taxonomies et de classification automatique.
  • Validation de l'exactitude et de la réutilisabilité. Iknow a classé le contenu dans la taxonomie PubMed et dans une taxonomie propriétaire avec une exactitude supérieure à 95 pour cent, et a confirmé que l'algorithme d'apprentissage par l'exemple du Categorizer générait automatiquement un ensemble réutilisable de règles de catégorisation.

Parties prenantes et collaboration

Iknow est intervenue comme maître d'œuvre, travaillant directement avec la Société R pour mener l'évaluation, l'entreprise ne disposant pas elle-même d'expertise interne en évaluation comparative de la recherche d'entreprise et de l'analyse de texte.

Les défis et comment Iknow les a surmontés

Valider de manière indépendante les affirmations des éditeurs en matière de classification automatique

Sans référence crédible et objective, la Société R risquait de choisir une plateforme de recherche d'entreprise sur la foi d'arguments marketing plutôt que de performances vérifiées. Iknow y a répondu en sélectionnant la SAP BusinessObjects Text Analysis Suite précisément pour ses capacités supérieures d'extraction d'entités et de catégorisation, et en l'utilisant comme point de comparaison indépendant face aux produits évalués par la Société R.

Produire une évaluation assez robuste pour être fiable à l'échelle réelle

Un échantillon de test restreint ou artificiel n'aurait pas donné à la Société R l'assurance que les résultats tiendraient face à son contenu scientifique réel et à grande échelle. Iknow y a répondu en rassemblant plus de 50 000 documents représentant plus de 75 gigaoctets issus de trois sources faisant autorité, puis en exécutant 15 analyses distinctes de taxonomie et de classification pour valider les résultats.

Résultats et impact

Résultats quantitatifs

  • Taille du corpus : plus de 50 000 documents scientifiques et techniques analysés, issus de trois sources faisant autorité : DTIC, DOE et PubMed.
  • Volume de données : données d'entrée dépassant 75 gigaoctets.
  • Analyses réalisées : 15 analyses distinctes réalisées, dont des tâches de création de taxonomies et de classification automatique.
  • Exactitude atteinte : exactitude de classification supérieure à 95 pour cent, tant sur la taxonomie PubMed que sur une taxonomie propriétaire.
  • Durée de la mission : mission de deux mois.

Résultats qualitatifs

La Société R a procédé à l'achat éclairé d'un nouveau produit de recherche d'entreprise sur la base de l'analyse et des livrables d'Iknow — la preuve directe que l'évaluation a débouché sur une véritable décision d'achat et non sur un simple rapport d'évaluation. Iknow a également recommandé à l'entreprise d'acquérir un produit d'analyse de texte et de l'intégrer à l'outil de recherche d'entreprise afin de créer un processus automatisé de bout en bout d'acquisition, de balisage et d'indexation du contenu. Le logiciel d'analyse de texte enrichirait l'outil de recherche d'entreprise grâce à l'extraction d'entités, au résumé automatisé et à la classification automatique — prolongeant la valeur de la preuve de concept en une recommandation de feuille de route technologique plus large.

Délai avant impact

Dans le cadre de la mission de deux mois, Iknow a livré une évaluation de classification automatique validée et réutilisable dépassant 95 pour cent d'exactitude, fournissant à la Société R des preuves objectives pour prendre une décision d'achat éclairée en matière de recherche d'entreprise et une feuille de route pour enrichir encore cette plateforme de capacités d'analyse de texte.

Les capacités d’Iknow démontrées

Compétences clés

  • Développement de preuves de concept en IA et en analyse de texte
  • Classification automatisée de contenu et extraction d'entités
  • Conception et développement de taxonomies
  • Évaluation technologique neutre vis-à-vis des éditeurs

Méthodes et cadres

  • Évaluation comparative sur corpus représentatif à grande échelle
  • Génération de taxonomies et de règles par apprentissage par l'exemple (LBE)
  • Validation de données multi-sources (taxonomies publiques et propriétaires)

Technologies et outils

  • SAP BusinessObjects Text Analysis XI 3.0 (Categorizer Workbench, ThingFinder Workbench)
  • Base de données embarquée Oracle XE

Mettez cette expérience au service de votre problème.

Une grande partie de notre travail ne figure jamais sur le site. Réservez un appel, indiquez-nous votre secteur et nous vous présenterons les missions qui correspondent au vôtre.