شناسایی مشتریان تکراری در بانکها و موسسات مالی، یکی از کلیدیترین مراحل در سامانههای ضدپولشویی، رتبهبندی اعتباری و ذینفع واحد است. همچنین تکمیل و تصحیح اطلاعات هویتی مشتریان از کاربردهای دیگر استخراج مشتریان مشابه است. کد ملی و کد اقتصادی ثبت شده برای مشتریان حقیقی و حقوقی از اعتبار مناسبی برخوردار نیستند. در نتیجه شناسایی مشتریان یگانه از طریق اطلاعات هویتی مشتریان مانند نام، نام خانوادگی، نام پدر، تاریخ و محل تولد انجام میگیرد. اطلاعات هویتی مشتریان به زبان فارسی در پایگاه داده ثبت شده است و همین مسئله چالشهایی از قبیل کلمات چند املائی و اشتباهات نگارشی را ایجاد کرده است. در این مقاله، سامانه هوشمند تطبیق تقریبی اطلاعات هویتی برای شناسایی مشتریان تکراری طراحی و پیادهسازی شده و الگوریتم لوناشتاین برای تطبیق تقریبی اطلاعات فارسی هویتی مشتریان توسعه داده شده است. سامانه پیشنهادی بر روی مشتریان چندین بانک خصوصی و دولتی طراحی و اجرا شده است. نتایج نشان میدهد که سامانه ارائه شده از دقت و سرعت بالایی برخوردار است. نتایج پیادهسازی نشان میدهد که با استفاده از هرس هوشمندانه سرعت استخراج مشتریان تکراری تقریبا تا 2 برابر بهبود یافته است.
نصیری، جلالالدین، امیرمحمود میر، و آرمان ساجدینژاد. 1397. ارایه روش هوشمند تطبیق تقریبی اطلاعات هویتی برای مشتریان بانک به وسیله متنکاوی. مقاله ارائه شده در پنجمین همایش ملی مدیران فناوری اطلاعات، تهران.
