ارائه یک ماژول نرم‌افزاری در راستای ایجاد شبکه استنادی پارساهای موجود در پایگاه اطلاعات علمی ایران (گنج)

ارائه یک ماژول نرم‌افزاری در راستای ایجاد شبکه استنادی پارساهای موجود در پایگاه اطلاعات علمی ایران (گنج)
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
چکیده

ارجاعات، که در مدارک علمی به وسیله رشته‌های مرجع در انتهای مدارک آورده می‌شوند، را می‌توان به عنوان ابزاری برای یافتن اطلاعات مورد علاقه به‌ کار برد. همچنین می‌توان از آن‌ها به عنوان معیاری برای بررسی تاثیر و اهمیت یک مدرک علمی و در سطحی بالاتر، به عنوان معیاری برای بررسی صلاحیت پژوهشگران برای ارتقا، اعطای پژوهانه و پروژه‌های تحقیقاتی استفاده کرد. استفاده از ارجاعات با اهداف ذکر شده نیازمند ساخت شبکه تحلیل استنادی است تا روابط بین موجودیت‌هایی مانند اسناد، پژوهشگران، نشریات، دانشگاه‌ها و پژوهشگاه‌ها، انتشارات و ... مشخص گردد. ساخت شبکه تحلیل استنادی بر روی مجموعه‌ای از اسناد علمی به صورت سنتی (دستی) فرایندی بسیار زمان‌بر بوده و برای مجموعه‌های بزرگ از مدارک ممکن نیست. در نتیجه، به روش‌هایی نیازمندیم که بتوانند با ورودی مجموعه‌ای از مدارک علمی، به طور خودکار شبکه تحلیل استنادی متناظر با آن را ایجاد کنند.

پایگاه اطلاعات علمی ایران (گنج) از مهم‌ترین منابع علمی زبان فارسی بوده که توسط پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) توسعه یافته و دربرگیرنده اغلب پارساهای خاتمه‌یافته پژوهشگران ایرانی است. با توجه به اهمیت این پایگاه اطلاعاتی و عدم وجود روش‌هایی برای ساخت خودکار شبکه‌های تحلیل استنادی در زبان فارسی، در این پژوهش به مساله ساخت خودکار شبکه‌های تحلیل استنادی در پارساهای فارسی‌زبان می‌پردازیم. در این راستا، در ابتدا مساله ساخت خودکار شبکه تحلیل استنادی را به زیرمساله‌هایی چون استخراج مراجع از تمام‌متن، تعیین نوع مراجع، تجزیه مراجع و بررسی تطابق مراجع و مولفه‌های آن‌ها تقسیم نموده و در ادامه، با در نظر گرفتن این مسائل به عنوان مسائلی از جنس دسته‌بندی، از روش‌های یادگیری ماشینی و الگوریتم‌های تطبیق رشته تقریبی برای حل آن‌ها استفاده می‌کنیم. لازم به ذکر است که با توجه به فراوانی ارجاعات به منابع انگلیسی زبان در مدارک علمی فارسی، راه‌کارهای ارائه شده علاوه بر مراجع فارسی‌زبان، مراجع انگلیسی‌زبان را نیز در نظر می‌گیرند. روش یادگیری ماشینی استفاده شده در این پژوهش، روش بردار ماشین پشتیبان بوده که از نوع با نظارت است. با توجه به نیاز این روش‌ها به مجموعه داده‌هایی برچسب خورده و عدم وجود چنین داده‌هایی برای زبان فارسی، در این پژوهش چندین مجموعه داده برای مسائل موردنظر ایجاد می‌شود.

پس از ارائه راه‌کار برای زیر مساله‌های موردنظر، آن‌ها را با یکدیگر ترکیب کرده و تحت یک ماژول نرم‌افزاری ارائه می‌کنیم. ماژول ارائه شده، با دریافت تمام‌متن و فراداده‌های متناظر مجموعه‌ای از پارساها، شبکه تحلیل استنادی مربوطه را ایجاد کرده و در قالب Json خروجی می‌دهد. نتایج ارزیابی راه‌کار نهایی ایجاد شده نشان‌دهنده مقادیر 1 به عنوان پارامتر دقت، 0.78 به عنوان پارامتر فراخوانی و 0.88 به عنوان پارامتر F1 در بازیابی و تشخیص تطابق رشته‌های مرجع است.

استناد

پاک‌نیت، نصراله، و جلال‌الدین نصیری. 1399. ارائه یک ماژول نرم‌افزاری در راستای ایجاد شبکه استنادی پارساهای موجود در پایگاه اطلاعات علمی ایران (گنج). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.

فایل پیوست
خلاصه طرح (123.69 کیلوبایت)
دریافت تمام متن (3.6 مگابایت)
شماره :
3290
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:35
X
Chat Icon