من 75 غيغابايت من الأدبيات العلمية إلى نموذج تصنيف قابل لإعادة الاستخدام: إثبات مفهوم للبحث المؤسسي.
شركة تكنولوجيا حيوية متخصصة في العلاجات البشرية · الأدوية والتقنية الحيوية
قياس دقة التصنيف الآلي عبر ثلاثة مصادر بيانات فيدرالية لشركة تكنولوجيا حيوية عالمية

الملخص التنفيذي
أرادت الشركة R، وهي واحدة من كبريات شركات التقنية الحيوية في العالم، تحسين قدرتها على البحث المؤسسي، وكان التصنيف التلقائي — أي المسح التلقائي لمحتوى الوثائق وإسناد الفئات والكلمات المفتاحية — من بين أهم متطلباتها للمنتج. وأرادت الشركة R مقارنة نتائج التصنيف التلقائي لمنتجات البحث المؤسسي التي كانت تدرسها بنتائج أحد المنتجات الرائدة في تحليل النصوص، لكنها كانت تفتقر إلى الخبرة الداخلية لإجراء ذلك التقييم. وطُلب من Iknow إجراء التقييم، وقد اختيرت لمعرفتها التقنية العميقة وخبرتها بالعديد من المنتجات الرائدة في البحث المؤسسي وتحليل النصوص.
اختارت Iknow حزمة SAP BusinessObjects Text Analysis Suite لقدراتها المتفوقة في استخراج الكيانات والتصنيف، وحللت أكثر من 50,000 وثيقة علمية وتقنية مستمدة من Defense Technical Information Center ووزارة الطاقة الأمريكية وقاعدة بيانات PubMed التابعة لـ National Library of Medicine، بإجمالي بيانات إدخال تجاوز 75 غيغابايت. وباستخدام SAP BusinessObjects Text Analysis XI 3.0 وقاعدة بياناتها المدمجة Oracle XE وأداتي Categorizer وThingFinder Workbench، أجرت Iknow 15 تحليلاً منفصلاً، شملت مهام إنشاء التصنيفات والتصنيف التلقائي، وصنفت المحتوى في تصنيف PubMed وفي تصنيف خاص بالشركة R على حد سواء بدقة تجاوزت 95 بالمئة، مع توليد مجموعة قواعد تصنيف قابلة لإعادة الاستخدام. وأجرت الشركة R عملية شراء مدروسة لمنتج بحث مؤسسي جديد استنادًا إلى تحليل Iknow، كما أوصت Iknow إضافة إلى ذلك بدمج منتج لتحليل النصوص مع تلك المنصة لبناء عملية آلية متكاملة من طرف إلى طرف لاقتناء المحتوى ووسمه وفهرسته.
الخلفية والسياق
نبذة عن العميل
الشركة R هي واحدة من أكبر شركات التقنية الحيوية المستقلة في العالم. وتعتمد منظمة البحث والتطوير في الشركة R على قدرة علمائها على العثور بموثوقية على الأبحاث السابقة والبناء عليها ضمن مجموعة كبيرة ومتنامية باستمرار من الأدبيات العلمية والتقنية.
سياق القطاع
بالنسبة لشركة تقنية حيوية كثيفة البحث، تعتمد جودة البحث المؤسسي اعتمادًا كبيرًا على مدى جودة وسم المحتوى العلمي والتقني وتصنيفه، إذ يحتاج الباحثون إلى العثور بموثوقية على الأبحاث السابقة والاستخبارات التنافسية والوثائق التقنية عبر مجموعة ضخمة ومتنامية. وبحلول عام 2010، أصبح التصنيف التلقائي معيار تقييم قياسيًا لمنصات البحث المؤسسي، لكن ادعاءات الموردين بشأن دقة التصنيف كانت متفاوتة بشدة ويصعب التحقق منها بشكل مستقل. وقد منح قياس منتجات البحث المؤسسي مقابل محرك تحليل نصوص مستقل ومجرب الشركة R وسيلة موضوعية للتحقق من أداء الموردين قبل الالتزام بالشراء. كما أن الاختبار على مجموعات بيانات علمية وتقنية عامة كبيرة وموثوقة مثل PubMed وDTIC وDOE أعطى التقييم مصداقية حقيقية، لأنها كانت بالضبط نوع المحتوى الذي يعتمد عليه باحثو الشركة R أنفسهم.
الوضع الراهن
أرادت الشركة R تحسين قدراتها في البحث المؤسسي، وكان التصنيف التلقائي من بين أهم متطلباتها للمنتج، ومقارنة نتائج التصنيف التلقائي لمنتجات البحث المؤسسي قيد الدراسة بنتائج أحد المنتجات الرائدة في تحليل النصوص. ولم تكن لدى الشركة R الخبرة الداخلية لإجراء هذا التقييم، فطلبت من Iknow القيام به.
المشكلة / التحدي
- لا وسيلة موضوعية للتحقق من ادعاءات الدقة لدى الموردين. كانت الشركة R بحاجة إلى تقييم وظيفة التصنيف التلقائي كمتطلب رئيسي لشراء نظام البحث المؤسسي، لكنها كانت تفتقر إلى وسيلة موضوعية للتحقق من ادعاءات الموردين.
- لا خبرة داخلية للتقييم. لم تكن لدى الشركة R الخبرة الداخلية لقياس أداء التصنيف التلقائي في البحث المؤسسي بشكل مستقل.
- لا مجموعة اختبار تمثيلية واسعة النطاق. كان أي قياس مرجعي يحتاج إلى الاختبار على محتوى علمي وتقني كبير وتمثيلي حقًا، لا على عينة صغيرة أو مصطنعة.
- لا منهجية قابلة لإعادة الاستخدام بعد اختبار واحد. كانت الشركة R بحاجة إلى أن تكون منهجية التصنيف الناتجة قابلة لإعادة الاستخدام، لا مجرد تحليل لمرة واحدة.
أهداف المشروع
- إجراء قياس مرجعي مستقل لدقة التصنيف التلقائي لمنتجات البحث المؤسسي التي كانت الشركة R تدرسها.
- اختبار ذلك القياس على مجموعة كبيرة وتمثيلية من الوثائق العلمية والتقنية.
- تصنيف المحتوى في تصنيف عام راسخ وفي تصنيف خاص بالشركة R على حد سواء.
- تسليم منهجية تصنيف ومجموعة قواعد قابلتين لإعادة الاستخدام، لا تحليلًا لمرة واحدة.
نهج Iknow
كيف نظمت Iknow العمل
نظمت Iknow المهمة حول اختيار منصة مرجعية مستقلة، وتجميع مجموعة بيانات كبيرة وتمثيلية، وتنفيذ تحليلات متعددة للتصنيفات والتصنيف التلقائي، والتحقق من الدقة وقابلية إعادة الاستخدام، بما يعكس منهجية Iknow لإثبات المفهوم في مجال الذكاء الاصطناعي القائمة على التحقق من نهج تقني بأدلة حقيقية قبل قرار الشراء.
الأنشطة والقرارات الرئيسية
- اختيار المنصة المرجعية. اختارت Iknow حزمة SAP BusinessObjects Text Analysis Suite لتحليل محتوى الشركة R نظرًا لقدراتها المتفوقة في استخراج الكيانات والتصنيف.
- مجموعة بيانات تمثيلية واسعة النطاق. تلقت Iknow أكثر من 50,000 وثيقة علمية وتقنية من DTIC وDOE وPubMed، وتضمنت كل مجموعة بيانات تصنيفًا خاصًا بالمصدر ووثائق بنصها الكامل وملخصات، بإجمالي بيانات إدخال تجاوز 75 غيغابايت.
- تهيئة المنصة. نفذت Iknow المعالجة والتحليل باستخدام SAP BusinessObjects Text Analysis XI 3.0 مع قاعدة البيانات المدمجة Oracle XE وأداتي Categorizer Workbench وThingFinder Workbench.
- التصنيفات واستخراج الكيانات. استخدمت Iknow خوارزمية التعلم بالأمثلة والمحرك القائم على القواعد في Categorizer Workbench لإنشاء التصنيفات وصيانتها، وأداة ThingFinder Workbench لتحديد الكيانات واستخراجها تلقائيًا من النص.
- قياس مرجعي متعدد التحليلات. أجرت Iknow 15 تحليلاً منفصلاً على مجموعة البيانات التي تجاوزت 50,000 وثيقة، شملت مهام متنوعة لإنشاء التصنيفات والتصنيف التلقائي.
- التحقق من الدقة وقابلية إعادة الاستخدام. صنفت Iknow المحتوى في تصنيف PubMed وفي تصنيف خاص بدقة تجاوزت 95 بالمئة، وأكدت أن خوارزمية التعلم بالأمثلة في Categorizer تولد تلقائيًا مجموعة قواعد تصنيف قابلة لإعادة الاستخدام.
أصحاب المصلحة والتعاون
عملت Iknow بصفتها المقاول الرئيسي، متعاونة مباشرة مع الشركة R لإجراء التقييم نظرًا لافتقار الشركة نفسها إلى الخبرة الداخلية في القياس المرجعي للبحث المؤسسي وتحليل النصوص.
التحديات وكيف تغلبت عليها Iknow
التحقق المستقل من ادعاءات الموردين بشأن التصنيف التلقائي
من دون مرجع موضوعي وموثوق، كانت الشركة R تخاطر باختيار منصة بحث مؤسسي استنادًا إلى ادعاءات تسويقية من الموردين بدلاً من أداء متحقق منه. عالجت Iknow ذلك باختيار حزمة SAP BusinessObjects Text Analysis Suite تحديدًا لقدراتها المتفوقة في استخراج الكيانات والتصنيف، واستخدامها نقطة مقارنة مستقلة مقابل المنتجات التي كانت الشركة R تقيمها.
إنتاج قياس مرجعي متين بما يكفي للثقة به على النطاق الحقيقي
ما كانت عينة اختبار صغيرة أو مصطنعة لتمنح الشركة R الثقة بأن النتائج ستصمد أمام محتواها العلمي الحقيقي الواسع النطاق. عالجت Iknow ذلك بتجميع أكثر من 50,000 وثيقة تجاوز حجمها 75 غيغابايت من ثلاثة مصادر موثوقة، ثم تنفيذ 15 تحليلاً منفصلاً للتصنيفات والتصنيف التلقائي للتحقق من النتائج.
النتائج والأثر
النتائج الكمية
- حجم المجموعة: تحليل أكثر من 50,000 وثيقة علمية وتقنية مستمدة من ثلاثة مصادر موثوقة: DTIC وDOE وPubMed.
- حجم البيانات: بيانات إدخال تجاوزت 75 غيغابايت.
- التحليلات المنفذة: تنفيذ 15 تحليلاً منفصلاً، شملت مهام إنشاء التصنيفات والتصنيف التلقائي.
- الدقة المحققة: دقة تصنيف تجاوزت 95 بالمئة مقابل تصنيف PubMed ومقابل تصنيف خاص على حد سواء.
- مدة المهمة: مهمة استمرت شهرين.
النتائج النوعية
أجرت الشركة R عملية شراء مدروسة لمنتج بحث مؤسسي جديد استنادًا إلى تحليل Iknow ومخرجاتها، وهو دليل مباشر على أن القياس المرجعي أفضى إلى قرار شراء حقيقي لا إلى مجرد تقرير تقييم. كما أوصت Iknow الشركة بشراء منتج لتحليل النصوص ودمجه مع أداة البحث المؤسسي لإنشاء عملية آلية متكاملة من طرف إلى طرف لاقتناء المحتوى ووسمه وفهرسته. ومن شأن برنامج تحليل النصوص أن يعزز أداة البحث المؤسسي من خلال استخراج الكيانات والتلخيص الآلي ووظيفة التصنيف التلقائي، بما يمد قيمة إثبات المفهوم لتصبح توصية أوسع بخارطة طريق تقنية.
الوقت حتى تحقق الأثر
خلال المهمة التي استمرت شهرين، سلمت Iknow قياسًا مرجعيًا للتصنيف التلقائي متحققًا منه وقابلاً لإعادة الاستخدام بدقة تجاوزت 95 بالمئة، بما زود الشركة R بأدلة موضوعية لاتخاذ قرار شراء مدروس لنظام البحث المؤسسي وخارطة طريق لمواصلة تعزيز تلك المنصة بقدرات تحليل النصوص.
قدرات Iknow التي أثبتها المشروع
المهارات الأساسية
- تطوير إثباتات المفهوم في الذكاء الاصطناعي وتحليلات النصوص
- التصنيف الآلي للمحتوى واستخراج الكيانات
- تصميم التصنيفات وتطويرها
- القياس المرجعي التقني المحايد تجاه الموردين
الأساليب والأطر
- القياس المرجعي على مجموعات تمثيلية واسعة النطاق
- توليد التصنيفات والقواعد بالتعلم بالأمثلة (LBE)
- التحقق من البيانات متعددة المصادر (تصنيفات عامة وخاصة)
التقنيات والأدوات
- SAP BusinessObjects Text Analysis XI 3.0 (أداتا Categorizer Workbench وThingFinder Workbench)
- قاعدة البيانات المدمجة Oracle XE
ضع هذه الخبرة في خدمة مشكلتك.
كثير من أعمالنا لا يظهر على الموقع. احجز مكالمة وأخبرنا عن قطاعك وسنعرض عليك المشاريع التي تقابل مجالك.

