فقدان مجموعه دادههای تخصصی مرتبط با متون علمی توسعه الگوریتمها و روشها در حوزه پردازش زبان طبیعی (NLP) را در زبانهای کممنبعی مانند فارسی با مانع مواجه میسازد. در این پژوهش، برای مقابله با این چالش، PersianSciQA معرفی شده که مشتمل بر ۳۹,۸۰۹ جفت پرسش-پاسخ است. هر جفت شامل یک پرسش و یک قطعه پاسخ علمی مستخرج از چکیدههای مستندات علمی مستخرج از مخزن پایگاه علمی «گنج» متعلق به ایرانداک است. پرسشها و پاسخها با تخصیص یک امتیازی بین ۰ تا ۳ با هم مرتبط هستند که با استفاده از مدل زبانی بزرگ (LLM) تعیین شده است. هر امتیاز میزان ارتباط پرسش را با محتوای قطعه پاسخ همراه آن مشخص میکند. این مجموعه داده با به کارگیری یک روش دو مرحلهای prompting تولید و از طریق یک فرایند پیوسته (پایپلاین) شامل نرمالسازی متنی و حذف تکرارهای معنایی، پالایش شده است. اعتبارسنجی انسانی بر روی ۱,۰۰۰ نمونه توسط دو پژوهشگر حوزه پردازش زبان طبیعی، کیفیت مجموعهداده را بهبود داده و همبستگی (ضریب کاپای کوهن ۰.۶۶۴۲ = κ) بین مدلهای زبانی بزرگ و ارزیابی انسانی را تأیید کرده است. برای تعیین میزان ارزش و اثربخشی PersianSciQA ، نشان دادهایم که تنظیم دقیق (fine-tuning) مدلها با استفاده از این مجموعه داده ، میتواند عملکرد مدل را روی دادههای فارسی علمی به طور چشمگیری بهبود بخشد و ضریب همبستگی اسپیرمن ۰.۸۹۵ بدست آید. PersianSciQA منبع جدیدی برای تسهیل پژوهش در حوزه بازیابی اطلاعات و پاسخ به پرسش در قلمرو دادههای علمی فارسی است.
آقاداود جلفایی، صفورا، آزاده محبی، و زهرا همت. 1404. PersianSciQA: مجموعه داده جدید برای سیستم پرسش و پاسخ در حوزه علمی . مقاله ارائه شده در کنفرانس بینالمللی پیشرفتهای اخیر در پردازش زیان طبیعی، وارنا.
