Saltar al contenido
Iknow

De 75 gigabytes de literatura científica a un modelo de categorización reutilizable: una prueba de concepto de búsqueda empresarial.

Empresa biotecnológica especializada en terapias humanas · Farmacéutica y biotecnología

Comparación de la precisión de la autoclasificación en tres fuentes de datos federales para una empresa biotecnológica global

Resumen ejecutivo

La Empresa R, una de las principales compañías biotecnológicas del mundo, quería mejorar su capacidad de búsqueda empresarial, con la clasificación automática (el escaneo automático del contenido de los documentos y la asignación de categorías y palabras clave) como uno de sus principales requisitos de producto. La Empresa R quería comparar los resultados de clasificación automática de los productos de búsqueda empresarial que estaba considerando con los resultados de uno de los productos líderes de análisis de texto, pero carecía de la experiencia interna para realizar esa evaluación. Se pidió a Iknow que llevara a cabo la evaluación, seleccionada por su profundo conocimiento técnico y su experiencia con muchos de los principales productos de búsqueda empresarial y análisis de texto.

Iknow eligió la SAP BusinessObjects Text Analysis Suite por sus capacidades superiores de extracción de entidades y categorización, y analizó más de 50,000 documentos científicos y técnicos procedentes del Defense Technical Information Center, del Departamento de Energía de EE. UU. y de la base de datos PubMed de la National Library of Medicine, con un total de más de 75 gigabytes de datos de entrada. Utilizando SAP BusinessObjects Text Analysis XI 3.0, su base de datos integrada Oracle XE y las herramientas Categorizer y ThingFinder Workbench, Iknow realizó 15 análisis independientes, incluidas tareas de creación de taxonomías y de clasificación automática, clasificando el contenido tanto en la taxonomía de PubMed como en una taxonomía propietaria de la Empresa R con una precisión superior al 95 por ciento, y generando al mismo tiempo un conjunto de reglas de categorización reutilizable. La Empresa R realizó una compra informada de un nuevo producto de búsqueda empresarial basándose en el análisis de Iknow, e Iknow recomendó además integrar un producto de análisis de texto con esa plataforma para construir un proceso automatizado de extremo a extremo de adquisición, etiquetado e indexación de contenido.

Antecedentes y contexto

Acerca del cliente

La Empresa R es una de las mayores compañías biotecnológicas independientes del mundo. La organización de investigación y desarrollo de la Empresa R depende de que sus científicos puedan encontrar de manera confiable la investigación previa, y construir sobre ella, dentro de un corpus amplio y en constante crecimiento de literatura científica y técnica.

Contexto del sector

Para una compañía biotecnológica intensiva en investigación, la calidad de la búsqueda empresarial depende en gran medida de lo bien que esté etiquetado y categorizado el contenido científico y técnico, ya que los investigadores necesitan encontrar de manera confiable investigación previa, inteligencia competitiva y documentación técnica en un corpus enorme y creciente. Hacia 2010, la clasificación automática se había convertido en un criterio de evaluación estándar para las plataformas de búsqueda empresarial, pero las afirmaciones de los proveedores sobre la precisión de la clasificación variaban enormemente y eran difíciles de verificar de forma independiente. Comparar los productos de búsqueda empresarial con un motor de análisis de texto probado e independiente dio a la Empresa R una manera objetiva de validar el desempeño de los proveedores antes de comprometerse con una compra. Realizar las pruebas con conjuntos de datos científicos y técnicos públicos, grandes y autorizados, como PubMed, DTIC y DOE, dio a la evaluación una credibilidad real, ya que eran exactamente el tipo de contenido del que dependían los propios investigadores de la Empresa R.

Situación actual

La Empresa R quería mejorar sus capacidades de búsqueda empresarial, con la clasificación automática como uno de sus principales requisitos de producto, y comparar los resultados de clasificación automática de los productos de búsqueda empresarial en consideración con los de uno de los productos líderes de análisis de texto. La Empresa R no contaba internamente con la experiencia para realizar esta evaluación, así que pidió a Iknow que la llevara a cabo.

Problema / desafío

  • Sin una forma objetiva de validar las afirmaciones de precisión de los proveedores. La Empresa R necesitaba evaluar la funcionalidad de clasificación automática como requisito principal para su compra de búsqueda empresarial, pero carecía de una forma objetiva de validar las afirmaciones de los proveedores.
  • Sin experiencia interna para la evaluación. La Empresa R no tenía la experiencia interna para comparar de forma independiente el desempeño de la clasificación automática en búsqueda empresarial.
  • Sin un corpus de prueba representativo y a gran escala. Cualquier comparación debía probarse con contenido científico y técnico genuinamente grande y representativo, no con una muestra pequeña o artificial.
  • Sin una metodología reutilizable más allá de una prueba única. La Empresa R necesitaba que la metodología de categorización resultante fuera reutilizable, no un análisis de una sola vez.

Objetivos del proyecto

  • Comparar de forma independiente la precisión de clasificación automática de los productos de búsqueda empresarial que la Empresa R estaba considerando.
  • Probar esa comparación con un corpus grande y representativo de documentos científicos y técnicos.
  • Clasificar el contenido tanto en una taxonomía pública establecida como en una taxonomía propietaria de la Empresa R.
  • Entregar una metodología de categorización y un conjunto de reglas reutilizables, no un análisis de una sola vez.

El enfoque de Iknow

Cómo estructuró Iknow el trabajo

Iknow estructuró el proyecto en torno a la selección de una plataforma de referencia independiente, el ensamblaje de un conjunto de datos grande y representativo, la ejecución de múltiples análisis de taxonomía y clasificación, y la validación de la precisión y la reutilización, reflejando la metodología de pruebas de concepto de IA de Iknow para validar un enfoque tecnológico con evidencia real antes de una decisión de compra.

Actividades y decisiones clave

  • Selección de la plataforma de referencia. Iknow eligió la SAP BusinessObjects Text Analysis Suite para analizar el contenido de la Empresa R por sus capacidades superiores de extracción de entidades y categorización.
  • Conjunto de datos representativo a gran escala. Iknow recibió más de 50,000 documentos científicos y técnicos de DTIC, DOE y PubMed; cada conjunto de datos incluía una taxonomía específica de la fuente, documentos de texto completo y resúmenes, con datos de entrada totales que superaban los 75 gigabytes.
  • Configuración de la plataforma. Iknow realizó el procesamiento y el análisis utilizando SAP BusinessObjects Text Analysis XI 3.0, con la base de datos integrada Oracle XE y las herramientas Categorizer Workbench y ThingFinder Workbench.
  • Taxonomía y extracción de entidades. Iknow utilizó el algoritmo de aprendizaje por ejemplos y el motor basado en reglas del Categorizer Workbench para crear y mantener taxonomías, y el ThingFinder Workbench para identificar y extraer automáticamente entidades del texto.
  • Comparación mediante múltiples análisis. Iknow realizó 15 análisis independientes sobre el conjunto de más de 50,000 documentos, incluidas diversas tareas de creación de taxonomías y de clasificación automática.
  • Validación de precisión y reutilización. Iknow clasificó el contenido en la taxonomía de PubMed y en una taxonomía propietaria con una precisión superior al 95 por ciento, y confirmó que el algoritmo de aprendizaje por ejemplos del Categorizer generaba automáticamente un conjunto de reglas de categorización reutilizable.

Partes interesadas y colaboración

Iknow actuó como contratista principal, trabajando directamente con la Empresa R para realizar la evaluación, dada la falta de experiencia interna de la compañía en comparación de búsqueda empresarial y análisis de texto.

Desafíos y cómo Iknow los superó

Validar de forma independiente las afirmaciones de clasificación automática de los proveedores

Sin una referencia creíble y objetiva, la Empresa R corría el riesgo de seleccionar una plataforma de búsqueda empresarial basándose en las afirmaciones de marketing de los proveedores en lugar de en un desempeño verificado. Iknow lo abordó seleccionando la SAP BusinessObjects Text Analysis Suite precisamente por sus capacidades superiores de extracción de entidades y categorización, y usándola como punto de comparación independiente frente a los productos que la Empresa R estaba evaluando.

Producir una comparación lo bastante robusta para confiar en ella a escala real

Una muestra de prueba pequeña o artificial no habría dado a la Empresa R la confianza de que los resultados se sostendrían frente a su contenido científico real y a gran escala. Iknow lo abordó reuniendo más de 50,000 documentos que superaban los 75 gigabytes procedentes de tres fuentes autorizadas, y ejecutando después 15 análisis independientes de taxonomía y clasificación para validar los resultados.

Resultados e impacto

Resultados cuantitativos

  • Tamaño del corpus: Más de 50,000 documentos científicos y técnicos analizados, procedentes de tres fuentes autorizadas: DTIC, DOE y PubMed.
  • Volumen de datos: Datos de entrada superiores a 75 gigabytes.
  • Análisis realizados: 15 análisis independientes realizados, incluidas tareas de creación de taxonomías y de clasificación automática.
  • Precisión lograda: Precisión de clasificación superior al 95 por ciento tanto frente a la taxonomía de PubMed como frente a una taxonomía propietaria.
  • Duración del proyecto: Encargo de dos meses.

Resultados cualitativos

La Empresa R realizó una compra informada de un nuevo producto de búsqueda empresarial basándose en el análisis y los entregables de Iknow, evidencia directa de que la comparación produjo una verdadera decisión de compra y no solo un informe de evaluación. Iknow también recomendó que la compañía adquiriera un producto de análisis de texto y lo integrara con la herramienta de búsqueda empresarial para crear un proceso automatizado de extremo a extremo de adquisición, etiquetado e indexación de contenido. El software de análisis de texto potenciaría la herramienta de búsqueda empresarial mediante la extracción de entidades, el resumen automatizado y la funcionalidad de clasificación automática, extendiendo el valor de la prueba de concepto hacia una recomendación de hoja de ruta tecnológica más amplia.

Tiempo hasta el impacto

Dentro del proyecto de dos meses, Iknow entregó una comparación de clasificación automática validada y reutilizable con una precisión superior al 95 por ciento, proporcionando a la Empresa R evidencia objetiva para tomar una decisión de compra informada de búsqueda empresarial y una hoja de ruta para seguir potenciando esa plataforma con capacidades de análisis de texto.

Capacidades de Iknow demostradas

Competencias centrales

  • Desarrollo de pruebas de concepto de IA y analítica de texto
  • Clasificación automatizada de contenido y extracción de entidades
  • Diseño y desarrollo de taxonomías
  • Benchmarking tecnológico neutral respecto a proveedores

Métodos y marcos de trabajo

  • Benchmarking con corpus representativos a gran escala
  • Generación de taxonomías y reglas mediante aprendizaje por ejemplos (LBE)
  • Validación de datos de múltiples fuentes (taxonomías públicas y propietarias)

Tecnologías y herramientas

  • SAP BusinessObjects Text Analysis XI 3.0 (Categorizer Workbench, ThingFinder Workbench)
  • Base de datos integrada Oracle XE

Ponga esta experiencia a trabajar en su problema.

Gran parte de nuestro trabajo nunca llega a la web. Reserve una llamada, cuéntenos su sector y le mostraremos los proyectos que corresponden al suyo.