ارجاعات، که در مدارک علمی به وسیله رشتههای مرجع در انتهای مدارک آورده میشوند، را میتوان به عنوان ابزاری برای یافتن اطلاعات مورد علاقه به کار برد. همچنین میتوان از آنها به عنوان معیاری برای بررسی تاثیر و اهمیت یک مدرک علمی و در سطحی بالاتر، به عنوان معیاری برای بررسی صلاحیت پژوهشگران برای ارتقا، اعطای پژوهانه و پروژههای تحقیقاتی استفاده کرد. استفاده از ارجاعات با اهداف ذکر شده نیازمند ساخت شبکه تحلیل استنادی است تا روابط بین موجودیتهایی مانند اسناد، پژوهشگران، نشریات، دانشگاهها و پژوهشگاهها، انتشارات و ... مشخص گردد. ساخت شبکه تحلیل استنادی بر روی مجموعهای از اسناد علمی به صورت سنتی (دستی) فرایندی بسیار زمانبر بوده و برای مجموعههای بزرگ از مدارک ممکن نیست. در نتیجه، به روشهایی نیازمندیم که بتوانند با ورودی مجموعهای از مدارک علمی، به طور خودکار شبکه تحلیل استنادی متناظر با آن را ایجاد کنند.
پایگاه اطلاعات علمی ایران (گنج) از مهمترین منابع علمی زبان فارسی بوده که توسط پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) توسعه یافته و دربرگیرنده اغلب پارساهای خاتمهیافته پژوهشگران ایرانی است. با توجه به اهمیت این پایگاه اطلاعاتی و عدم وجود روشهایی برای ساخت خودکار شبکههای تحلیل استنادی در زبان فارسی، در این پژوهش به مساله ساخت خودکار شبکههای تحلیل استنادی در پارساهای فارسیزبان میپردازیم. در این راستا، در ابتدا مساله ساخت خودکار شبکه تحلیل استنادی را به زیرمسالههایی چون استخراج مراجع از تماممتن، تعیین نوع مراجع، تجزیه مراجع و بررسی تطابق مراجع و مولفههای آنها تقسیم نموده و در ادامه، با در نظر گرفتن این مسائل به عنوان مسائلی از جنس دستهبندی، از روشهای یادگیری ماشینی و الگوریتمهای تطبیق رشته تقریبی برای حل آنها استفاده میکنیم. لازم به ذکر است که با توجه به فراوانی ارجاعات به منابع انگلیسی زبان در مدارک علمی فارسی، راهکارهای ارائه شده علاوه بر مراجع فارسیزبان، مراجع انگلیسیزبان را نیز در نظر میگیرند. روش یادگیری ماشینی استفاده شده در این پژوهش، روش بردار ماشین پشتیبان بوده که از نوع با نظارت است. با توجه به نیاز این روشها به مجموعه دادههایی برچسب خورده و عدم وجود چنین دادههایی برای زبان فارسی، در این پژوهش چندین مجموعه داده برای مسائل موردنظر ایجاد میشود.
پس از ارائه راهکار برای زیر مسالههای موردنظر، آنها را با یکدیگر ترکیب کرده و تحت یک ماژول نرمافزاری ارائه میکنیم. ماژول ارائه شده، با دریافت تماممتن و فرادادههای متناظر مجموعهای از پارساها، شبکه تحلیل استنادی مربوطه را ایجاد کرده و در قالب Json خروجی میدهد. نتایج ارزیابی راهکار نهایی ایجاد شده نشاندهنده مقادیر 1 به عنوان پارامتر دقت، 0.78 به عنوان پارامتر فراخوانی و 0.88 به عنوان پارامتر F1 در بازیابی و تشخیص تطابق رشتههای مرجع است.
پاکنیت، نصراله، و جلالالدین نصیری. 1399. ارائه یک ماژول نرمافزاری در راستای ایجاد شبکه استنادی پارساهای موجود در پایگاه اطلاعات علمی ایران (گنج). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
