Aller au contenu
Iknow

De l'ingérable à l'exploitable : une preuve de concept de fouille de texte pour les données de la voix du client.

Entreprise pharmaceutique · Pharmacie et biotechnologie

Évaluer l'extraction d'entités, l'analyse de sentiment et l'intégration d'une taxonomie médicale sur des rapports internes réels

Résumé exécutif

Iknow a travaillé avec la direction des Affaires scientifiques de la Société J pour évaluer comment un logiciel avancé de fouille de textes pouvait identifier et extraire des enseignements d'un volume écrasant d'informations clients. Les Affaires scientifiques produisent, mettent en forme et diffusent des informations médicales et cliniques à l'appui de plus de 40 marques commerciales. Chacun des groupes de collecte d'informations de la Société J (ses agents de liaison des Affaires scientifiques sur le terrain, son centre de contact client, son groupe de communication médicale et son groupe de formation médicale) préparait des rapports mensuels de Voix du Client (VOC), et les Affaires scientifiques voulaient savoir si un logiciel d'analyse de texte pouvait rationaliser l'analyse et la diffusion de ce corpus d'informations en croissance constante.

Au cours d'une mission ciblée d'un mois, Iknow a retenu la suite SAP BusinessObjects Text Analysis pour analyser trois mois de rapports VOC non structurés portant sur une aire thérapeutique et un produit spécifiques, en traitant des fichiers d'entrée aux formats Microsoft Word, PowerPoint et PDF. Iknow a testé les fonctionnalités standard du produit, puis a développé des règles personnalisées propres aux Affaires scientifiques selon un processus itératif, en intégrant les conclusions du précédent projet d'audit des connaissances mené par Iknow et en incorporant MeSH (Medical Subject Headings), le vocabulaire médical contrôlé de la National Library of Medicine elle-même, pour constituer un lexique adapté au domaine. Iknow a également créé des règles personnalisées pour l'analyse de sentiment et pour repérer les phrases décrivant de possibles prochaines étapes ou opportunités de recherche. La preuve de concept a démontré que le moteur d'extraction d'entités du logiciel, associé à une taxonomie médicale personnalisée, pouvait extraire avec succès des termes, expressions et sentiments pertinents des rapports internes avec un bon équilibre de spécificité des résultats.

Contexte et historique

À propos du client

La division des Affaires scientifiques de la Société J produit, met en forme et diffuse des informations médicales et cliniques sur plus de 40 marques commerciales. Elle fonctionne avec environ 350 employés couvrant les États-Unis.

Contexte sectoriel

Cette preuve de concept est intervenue à un moment charnière pour la technologie sous-jacente : SAP avait acquis Business Objects début 2008, intégrant l'acquisition antérieure d'Inxight par Business Objects, dont les technologies SmartDiscovery et ThingFinder sont devenues le socle de SAP BusinessObjects Text Analysis. Pour les fonctions Affaires scientifiques et médicales du secteur pharmaceutique, les rapports de Voix du Client synthétisant les retours de nombreux canaux représentaient une charge analytique en croissance rapide mais très exigeante en travail manuel. La fouille de textes offrait un moyen de faire émerger systématiquement des tendances et des sentiments qui auraient sinon exigé une revue manuelle exhaustive, un travail aux enjeux cliniques et réglementaires réels dans un domaine où les signaux émergents de sécurité ou d'efficacité comptent. Ancrer une preuve de concept dans un vocabulaire de référence propre au domaine comme MeSH, plutôt que de s'en remettre au seul traitement générique du langage, traduisait une prise de conscience plus large du secteur : les contenus médicaux spécialisés et critiques pour la sécurité exigent plus de rigueur que ce qu'offre habituellement une analyse de texte standard.

Situation au moment de la mission

L'objectif de cette preuve de concept était d'étudier l'efficacité d'un logiciel d'analyse de texte pour rationaliser l'analyse et la diffusion des informations VOC. Le périmètre était délibérément restreint : analyser trois mois de rapports portant sur une aire thérapeutique et un produit spécifiques, et évaluer la capacité du logiciel à identifier et extraire les termes et expressions clés. Iknow a retenu la suite SAP BusinessObjects Text Analysis pour analyser le texte non structuré des rapports internes, extraire les informations critiques et catégoriser les résultats.

Problème / défi

  • Un volume écrasant et croissant d'informations clients. Les différents groupes des Affaires scientifiques généraient une quantité écrasante d'informations de Voix du Client qui devenait difficile à analyser et à diffuser manuellement.
  • Aucune approche éprouvée d'extraction automatisée d'enseignements. Il n'existait aucune méthode éprouvée pour utiliser la fouille de textes automatisée afin d'extraire des enseignements significatifs des rapports internes non structurés des Affaires scientifiques.
  • Des outils génériques de fouille de textes mal adaptés aux contenus médicaux. Les Affaires scientifiques avaient besoin d'un vocabulaire et d'une taxonomie reflétant leur domaine médical et clinique spécialisé, et non d'une approche générique de fouille de textes prête à l'emploi.
  • Aucune base de preuves pour un investissement technologique plus large. Les Affaires scientifiques avaient besoin de preuves réelles, et non de suppositions, sur le fonctionnement d'une plateforme d'analyse de texte avant de s'engager dans un déploiement plus large.

Objectifs du projet

  • Étudier l'efficacité d'un logiciel d'analyse de texte pour rationaliser l'analyse et la diffusion des informations VOC.
  • Analyser trois mois de rapports portant sur une aire thérapeutique et un produit spécifiques afin de tester les performances réelles du logiciel.
  • Évaluer la capacité du logiciel à identifier et extraire les termes et expressions clés des rapports.
  • Identifier les autres domaines des Affaires scientifiques où les logiciels de fouille et d'analyse de textes pourraient être appliqués.

L’approche d’Iknow

Comment Iknow a structuré la mission

Iknow a structuré la mission comme une preuve de concept ciblée et délimitée (en établissant une base de référence avec les fonctionnalités standard du logiciel, puis en personnalisant de manière itérative les règles et lexiques sur des contenus réels des Affaires scientifiques), conformément à la méthodologie de preuve de concept en IA d'Iknow, qui consiste à valider une approche technologique par des preuves avant tout investissement en production.

Activités et décisions clés

  • Choix de la plateforme. Iknow a retenu la suite SAP BusinessObjects Text Analysis pour analyser les rapports internes non structurés des Affaires scientifiques, extraire les informations critiques et catégoriser les résultats.
  • Analyse de fichiers multiformats. Iknow a analysé des fichiers d'entrée aux formats Microsoft Word, PowerPoint et PDF, reflétant la diversité réelle des types de documents effectivement produits par les groupes des Affaires scientifiques.
  • Développement itératif de règles personnalisées. Iknow a utilisé les fonctionnalités standard du produit comme base de référence, puis a développé des règles personnalisées propres aux Affaires scientifiques par un processus itératif d'analyse des sorties du produit.
  • Intégration des conclusions de l'audit des connaissances antérieur. Iknow a intégré les conclusions et recommandations de son précédent projet d'audit des connaissances pour ancrer la preuve de concept dans le paysage réel des contenus des Affaires scientifiques.
  • Intégration du lexique MeSH. Iknow a incorporé MeSH (Medical Subject Headings), le thésaurus de vocabulaire contrôlé de la National Library of Medicine utilisé pour indexer les articles de PubMed, afin de créer un lexique pertinent et propre au domaine.
  • Règles de sentiment et de détection d'opportunités. Iknow a créé des règles personnalisées pour l'analyse de sentiment, couvrant les mentions de produits positives comme négatives, et pour identifier les phrases évoquant une prochaine étape possible ou une opportunité de recherche complémentaire.

Parties prenantes et collaboration

Iknow est intervenu comme contractant principal, travaillant directement avec les Affaires scientifiques sur cette preuve de concept ciblée d'un mois, en s'appuyant sur la confiance établie lors de la précédente mission d'audit des connaissances menée par Iknow auprès de l'organisation.

Les défis et comment Iknow les a surmontés

Confronter un logiciel générique à un langage médical hautement spécialisé

Les logiciels d'analyse de texte prêts à l'emploi sont conçus pour le langage commercial général, et non pour le vocabulaire spécialisé et sensible en matière de sécurité des contenus des Affaires scientifiques pharmaceutiques. Iknow y a répondu en intégrant MeSH, le vocabulaire médical contrôlé de la National Library of Medicine elle-même, directement dans la preuve de concept, dotant le logiciel d'un lexique adapté au domaine plutôt que de s'en remettre à ses seules capacités de langage général.

Trouver l'équilibre entre précision et exhaustivité des enseignements

Des règles trop lâches auraient noyé les enseignements véritables dans le bruit, tandis que des règles trop strictes risquaient de passer entièrement à côté de termes et de sentiments significatifs. Iknow y a répondu par un processus itératif de développement de règles, en analysant à plusieurs reprises les sorties du produit et en affinant les règles personnalisées d'extraction et de sentiment jusqu'à atteindre, selon sa propre évaluation, un bon équilibre de spécificité des résultats.

Résultats et impact

Résultats quantitatifs

  • Périmètre de l'analyse : trois mois de rapports analysés pour une aire thérapeutique et un produit spécifiques.
  • Formats de documents traités : trois formats de fichiers d'entrée traités : Microsoft Word, PowerPoint et PDF.
  • Jeux de règles personnalisées livrés : règles personnalisées développées pour l'extraction d'entités, l'analyse de sentiment et l'identification des prochaines étapes et opportunités.
  • Opportunités d'extension identifiées : six domaines d'application supplémentaires identifiés pour un déploiement plus large de la fouille de textes : création de taxonomies, création de métadonnées, amélioration de la recherche et de la navigation, étiquetage pour la gestion de contenu, analyse des données du centre d'appels et analyse des rapports VOC.
  • Durée de la mission : une mission d'un mois.

Résultats qualitatifs

Iknow a démontré que le moteur d'extraction d'entités du produit SAP BusinessObjects Text Analysis, associé à une taxonomie médicale personnalisée, pouvait extraire avec succès des termes, expressions et sentiments pertinents des rapports internes des Affaires scientifiques, et a montré comment les règles et lexiques étaient créés et comment la racinisation pouvait identifier des termes significatifs supplémentaires. La preuve de concept a donné aux Affaires scientifiques la conviction, fondée sur des preuves, que la fouille de textes pouvait s'étendre bien au-delà des rapports VOC (à la création de taxonomies, à la création de métadonnées, à l'amélioration de la recherche et de la navigation, à l'étiquetage pour la gestion de contenu et à l'analyse des données du centre d'appels) et pouvait s'intégrer aux outils de business intelligence pour créer des tableaux de bord en ligne destinés au reporting de direction.

Délai avant impact

En une seule mission d'un mois, Iknow a livré une preuve de concept opérationnelle et évaluée couvrant les règles personnalisées, l'intégration d'un lexique médical et l'analyse de sentiment, accompagnée d'une vision documentée des extensions possibles de la technologie à l'ensemble des opérations des Affaires scientifiques.

Les capacités d’Iknow démontrées

Compétences clés

  • Développement de preuves de concept en IA et en fouille de textes
  • Classification automatisée de contenus et extraction d'entités
  • Intégration de taxonomies et de lexiques médicaux
  • Conception de règles d'analyse de sentiment

Méthodes et cadres

  • Développement et réglage itératifs des règles
  • Intégration de lexiques propres au domaine (MeSH)
  • Évaluation de la preuve de concept sur un périmètre défini

Technologies et outils

  • Suite SAP BusinessObjects Text Analysis
  • MeSH (Medical Subject Headings) ; extraction d'entités et racinisation

Mettez cette expérience au service de votre problème.

Une grande partie de notre travail ne figure jamais sur le site. Réservez un appel, indiquez-nous votre secteur et nous vous présenterons les missions qui correspondent au vôtre.