بدأت شركة «OpenAI» مرحلة جديدة من تطوير نماذجها تعتمد على جمع ملفات عمل فعلية من متعاقدين خارجيين، تتضمن مستندات ومشاريع حقيقية نفذوها في وظائفهم السابقة، بهدف تعليم الذكاء الاصطناعي كيفية أداء المهام المكتبية والمهنية المعقدة بدقة تحاكي البشر. وتستهدف هذه الاستراتيجية تجاوز بيانات الإنترنت العامة، للحصول على «بيانات عالية الجودة» تمكن النماذج المستقبلية من أتمتة الوظائف بالكامل وليس مجرد توليد النصوص.
آلية جمع البيانات عبر Handshake AI
تتعاون «OpenAI» في هذا المشروع مع شركة «Handshake AI» المتخصصة في بيانات التدريب، حيث يُطلب من المتعاقدين عدم الاكتفاء بتقديم ملخصات، بل رفع «مخرجات حقيقية» تم إنتاجها أثناء العمل. تهدف هذه الخطوة إلى تزويد الخوارزميات بسياق مهني دقيق يعكس طبيعة التحديات والحلول في بيئات العمل الواقعية، مما يرفع كفاءة النماذج في فهم الهياكل المعقدة للمشاريع المهنية.
نوعية الملفات المطلوبة وأداة Superstar Scrubbing
تشترط الشركة على المتعاقدين تقديم نماذج أصلية تشمل مستندات «Word»، ملفات «PDF»، عروض «PowerPoint»، جداول «Excel»، صوراً توضيحية، ومستودعات برمجية (Code Repositories). ولضمان الخصوصية، تُلزم الشركة المتعاقدين باستخدام أداة داخلية في «ChatGPT» تُدعى «Superstar Scrubbing»، صُممت خصيصاً لتنقية المحتوى وحذف البيانات الشخصية أو المعلومات الحساسة قبل إتمام عملية الرفع.
مخاطر الملكية الفكرية وتسريب أسرار الشركات
رغم الإجراءات التقنية للتنقية، يحمل هذا النهج مخاطر قانونية جدية تتعلق بانتهاك سرية البيانات. ووفقاً لتحذيرات إيفان براون، محامي الملكية الفكرية، فإن اعتماد شركات الذكاء الاصطناعي على تقدير المتعاقدين لتحديد ما هو «سري» يضعها في موقف قانوني هش؛ حيث قد يؤدي رفع ملفات مملوكة لشركات سابقة -حتى بعد تنقيحها- إلى نزاعات قضائية حول حقوق الملكية وتسريب أسرار تجارية دون تفويض رسمي.
