با توجه به حجم دادهها و مستندات ایجاد شده در پایگاههای تخصصی علمی مانند گنج، نیاز است که روشهای هوشمند و خودکار برای افزایش دقت و سرعت تخصیص کلیدواژه به این مستندات به کار گرفته شود. توسعه و بکارگیری این روشها نیازمند وجود معیارهای استاندارد برای ارزیابی و بهبود آنهاست. یکی از این معیارها، وجود یک مجموعه داده استاندارد است که حاوی مجموعهای از اسناد و کلیدواژههای تخصیص داده شده درست و کامل به آنها است. اگر چنین مجموعه دادهای موجود نباشد، نمیتوان به راحتی الگوریتمها و روشهای استخراج خودکار کلیدواژه از مستندات علمی را با یک معیار مشخص با هم مقایسه کرد و بکارگرفت.
در برخی از پژوهشهای انجام شده در حوزه استخراج خودکار کلیدواژه از مستندات فارسی، از مجموعه دادههایی استفاده شده لیکن این مجموعه دادهها یا دادههای علمی نیستند و یا در صورت استفاده از دادهها علمی، تنها کلیدواژههای نویسنده به عنوان کلیدواژههای تخصیص داده شده به یک سند علمی در آنها در نظر گرفته شده است. این در حالی است که در بسیاری از پژوهشهای انجام شده در زبان انگلیسی، مجموعه دادههای استاندارد و متعددی برای این منظور وجود دارد که در اغلب پژوهشها از آنها استفاده میشود.
بنابراین در این طرح پژوهشی، مجموعه دادهای از اسناد علمی (پایاننامهها و رسالهها) گنج به همراه کلیدواژههای مرتبط با آنها ایجاد میشود. مدارک نمایه شده در گنج، میتواند منبعی غنی برای ساخت مجموعه داده برای مساله استخراج کلیدواژه از مستندات علمی فارسی باشد. لیکن کلیدواژههای تخصیص داده شده به هر مدرک در فرایند نمایهسازی اغلب محدود هستند و حتی در برخی از موارد به دلیل محدودیتهای موجود در فرایند نمایهسازی، کامل نیستند. علاوه بر آن، مشخص نیست که هر کلیدواژه تخصیص داده شده به هر مدرک تا چه میزان به آن مدرک مرتبط است.
در فرایند ایجاد مجموعه داده در این طرح، ابتدا از مجموعهای از اسناد پایگاه گنج که کلیدواژههای تخصصی نمایهساز و نویسنده را دارند استفاده شده است. سپس براساس فرایندی ماشینی مجموعه کلیدواژه وسیعتری، به عنوان کلیدواژههای کاندید برای هر سند در نظر گرفته شده و در انتها نیز متخصصین نمایهساز، با بررسی مجدد هر سند و کلیدواژههای کاندید، کلیدواژههای تخصصی مناسب را از بین آنها انتخاب کردهاند. در نهایت 2838 داده در چهار حوزه موضوعی فنی و مهندسی، علوم انسانی، علوم و علوم کاربردی، و هنر در مجموعه داده قرار گرفتهاند که هر یک به طور متوسط دارای 10 کلیدواژه هستند. در انتها نیز پیشنهادهایی برای چگونگی بهرهبرداری از مجموعه داده استاندارد توسط جامعه علمی و انتشار آن ارائه شده است.
محبی، آزاده، عمار جلالیمنش، مرضیه زرینبال ماسوله، زهرا دهسرایی، علی سلیمیصدر، وحمید حسنی. 1400. تهیه مجموعه داده استاندارد فارسی برای مساله استخراج خودکار کلیدواژه از اسناد علمی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
