پژوهشنامه پردازش و مدیریت اطلاعات

پژوهشنامه پردازش و مدیریت اطلاعات

مروری بر روش‌های مبتنی بر یادگیری ماشین در تولید لاگ رخداد مصنوعی

نوع مقاله : مقاله مروری

نویسندگان
1 دکترای مهندسی صنایع، استاد، گروه مهندسی صنایع، دانشکده فنی و مهندسی، دانشگاه قم
2 دکترای مهندسی فناوری اطلاعات، پژوهشگر پسادکتری، گروه مهندسی صنایع، دانشکده فنی و مهندسی، دانشگاه قم
10.22034/jipm.2026.2095021.2265
چکیده
کمبود داده‌های واقعی به دلیل محدودیت‌های حریم خصوصی، هزینه‌های جمع‌آوری و کیفیت پایین داده، توسعه و ارزیابی الگوریتم‌های فرایندکاوی را با چالش مواجه کرده است. تولید داده‌های مصنوعی که ضمن حفظ ویژگی‌های آماری و ساختاری فرایند، ارتباط مستقیمی با نمونه‌های واقعی نداشته باشند، راهکاری مؤثر برای رفع این محدودیت‌ها محسوب می‌شود. هدف این پژوهش، ارائه مروری نظام‌مند بر روش‌های تولید لاگ رخداد مصنوعی در حوزه فرایندکاوی است که بر پایه الگوریتم‌های یادگیری ماشین توسعه یافته‌اند. جستجوی نظام‌مند در پایگاه‌های ScienceDirect، PubMed، IEEE Xplore، SpringerLink تا مرداد 1405 (آگوست ۲۰۲۵) صورت گرفت. از میان ۱۹۹۰ رکورد اولیه، پس از حذف مقالات تکراری‌ و غربالگری در سه مرحله (عنوان، عنوان و چکیده، متن کامل) در نهایت 15 مطالعه برای تحلیل نهایی انتخاب شدند.
یادگیری ماشین پارادایمی پیشرفته در تولید لاگ رخداد مصنوعی است و بسته به نوع روش توسعه داده شده و روند تکاملی از روش‌های یادگیری ماشین سنتی (مانند درخت تصمیم)، تا روش‌های پیشرفته‌تر مبتنی بر یادگیری عمیق و هوش مولد (مانند مدل‌های زبانی، اتوانکودرها و...) و روش‌های ترکیبی را در برمی‌گیرد. تحلیل مطالعات، نشان‌دهنده توجه فزاینده به دسته دوم یعنی روش‌های مبتنی بر یادگیری عمیق و هوش مولد است. هدف اصلی تولید لاگ‌های رخداد مصنوعی ارزیابی الگوریتم پنج مقاله (33%)، حفظ محرمانگی پنج مقاله (33%)، تولید داده منفی دو مقاله (13%) تولید داده چند بعدی دو مقاله (13%) تحلیل سناریو یک مقاله (7%) عنوان شده است. در تمام مقالات معیارهای وفاداری (یعنی سنجش شباهت آماری داده‌های مصنوعی به داده‌های واقعی) برای ارزیابی روش استفاده شده است، درحالی‌که کاربردپذیری در فرایندکاوی (یعنی ارزیابی روش‌های کشف یا بررسی انطباق با داده‌های مصنوعی) در هشت مقاله (53%) و محرمانگی تنها در دو مقاله (13%) گزارش شده است. فقدان چارچوب ارزیابی یکپارچه و نیز نبود ارزیابی‌های محرمانگی، چالش اصلی در مقایسه روش‌هاست. مسیرهای آتی پژوهش بر ترکیب توانایی‌های مدل‌های مولد با مدل‌های ساخت‌یافته (مانند شبکه‌های پتری) برای تضمین اعتبار ساختاری داده‌های تولیدشده از طریق ترکیب داده و دانش و نیز ارزیابی مقایسه‌ای مجموعه‌ای از مکانیسم‌های تولید (یعنی درک چگونگی تأثیر انتخاب مکانیسم‌های تولید مختلف بر عملکرد الگوریتم‌های فرایندکاوی) متمرکز خواهد بود. این سوال همچنان بی‌پاسخ مانده است که کدام مکانیسم‌(های) تولید، لاگ‌های رخداد بهتری برای فرایندکاوی تولید می‌کنند.
کلیدواژه‌ها
موضوعات

عنوان مقاله English

A survey on machine learning-driven synthetic event log generation

نویسندگان English

Jalal Rezaeenour 1
Mansoureh Yari 2
1 PhD in Industrial Engineering, Professor, Department of Industrial Engineering, University of Qom,
2 PhD of Information Technology Engineering, Post Doc Researcher, Department of Industrial Engineering, University of Qom
چکیده English

The scarcity of real-world data, driven by privacy constraints, data collection costs, and poor data quality, poses a major challenge to the development and evaluation of process mining algorithms. Synthetic event logs that preserve the statistical and structural characteristics of real processes while maintaining no direct linkage to real-world instances offer an effective means of addressing these limitations. This study presents a systematic review of machine learning–based methods for synthetic event log generation in process mining. A systematic search was conducted in ScienceDirect, PubMed, IEEE Xplore, and SpringerLink through August 2025. Of 1,990 initially identified records, 15 studies were ultimately included following duplicate removal and a three-stage screening process (title, title and abstract, and full text).
Machine learning has emerged as an advanced paradigm for synthetic event log generation, encompassing an evolutionary spectrum from traditional machine learning approaches, such as decision trees, to advanced deep learning and generative artificial intelligence methods, including language models and autoencoders, as well as hybrid approaches. The reviewed studies indicate a growing emphasis on deep learning- and generative AI–based methods. The primary objectives of synthetic event log generation were algorithm evaluation (5 studies, 33%), confidentiality preservation (5, 33%), negative event generation (2, 13%), multidimensional data generation (2, 13%), and scenario analysis (1, 7%). Fidelity, defined as the statistical similarity between synthetic and real data, was assessed in all studies. However, process mining utility, defined as the evaluation of process discovery or conformance checking using synthetic data, was reported in only eight studies (53%), while privacy was explicitly evaluated in only two (13%). The absence of an integrated evaluation framework and the limited assessment of privacy remain major challenges for the reliable comparison of existing approaches.
Future research should focus on integrating the generative capabilities of advanced models with structured process models, such as Petri nets, to ensure the structural validity of generated logs through the integration of data and domain knowledge. Comparative evaluation of different generation mechanisms is also needed to determine how the choice of generation mechanism affects the performance of downstream process mining algorithms. A fundamental question therefore remains unresolved: which generation mechanism(s) can produce synthetic event logs that are most effective for process mining?

کلیدواژه‌ها English

Synthetic Event Log
Process Mining
Machine Learning
Deep learning. Survey

مقالات آماده انتشار، پذیرفته شده
انتشار آنلاین از 06 مهر 1405

  • تاریخ دریافت 30 تیر 1405
  • تاریخ بازنگری 24 شهریور 1405
  • تاریخ پذیرش 25 شهریور 1405