در این مقاله یک روش جدید برای برچسبگذاری تصاویر موجود در متون علمی فارسی معرفی میشود. در اسناد و مقالات علمی، تصاویر حاوی اطلاعلات مهمی هستند و در بسیاری از موارد با بررسی آنها به تنهایی میتوان به ایده اصلی و یا نتایج مهم مقاله علمی پی برد، بدون اینکه لازم باشد کل مقاله را مطالعه کرد. به خاطر رشد روز افزون دادههای تصویری، بازیابی تصاویر از اسناد علمی توجه زیادی به خود جلب کرده است و تبدیل به یک موضوع رو به رشد در ادبیات شده است. اولین قدم در بازیابی تصاویر تخصیص برچسبهای توصیفکننده به هر تصویر است. در اینجا برای استخراج برچسب تصویر از متن سندی که تصویر به آن تعلق دارد استفاده شده است. زیرنویس و قسمتی از متن سند که در آن، به تصویر مورد نظر اشاره شده است در نظر گرفته میشود. عبارات اسمی در متن همراه تصویر با استفاده از پنج روش متفاوت؛ فراوانی عبارات در سند، معکوس فراوانی سند، فراوانی کلمه- معکوس فراوانی سند، شباهت کسینوسی عبارات با زیرنویس و ترکیب روش فراوانی کلمه- معکوس فراوانی سند و شباهت کسینوسی با زیرنویس، رتبهبندی میشوند. برچسبهای انتخابی برای تصویر در هر روش، عبارات اسمی با رتبه بالاتر در آن روش است. روشهای معرفی شده با استفاده از داده آزمایشی از پایگاه اطلاعات علمی ایران (گنج) که منبع اصلی اسناد علمی فارسی است، ارزیابی میشوند. طبق نتایج بدست آمده در این تحقیق روش فراوانی کلمه- معکوس فراوانی سند بهترین روش برای برچسب زدن تصاویر موجود در اسناد علمی است.
فخرزاده، آزاده، محدثه رهنما، و جلالالدین نصیری. 1401. ارائه روشی برای برچسب زدن تصاویر موجود در متون علمی فارسی با استفاده از روشهای پردازش متن. پژوهشنامه پردازش و مدیریت اطلاعات 37 (3): 895-913.
