استخراج فراداده

۱.

ارائه روشی ساختار محور برای ایجاد پایگاه داده از تصاویر مستخرج از اسناد علمی: مورد مطالعه پایگاه اطلاعات علمی ایران (گنج)(مقاله علمی وزارت علوم)

نویسنده: آزاده فخرزاده امیرحسین صدیقی

منبع: پژوهشنامه پردازش و مدیریت اطلاعات دوره ۳۵ بهار ۱۳۹۹ شماره ۳ (پیاپی ۱۰۱) 729-754

کلیدواژه‌ها: پردازش تصویر استخراج تصویر استخراج فراداده فناوری اطلاعات

حوزه‌های تخصصی:

حوزه‌های تخصصی علم اطلاعات و دانش‌شناسی

تعداد بازدید : ۵۷۰ تعداد دانلود : ۴۵۵

تصاویر موجود در مدارک علمی غالبا حاوی اطلاعات مهمی هستند. اولین قدم برای بازیابی اطلاعات از این تصاویر ایجاد یک پایگاه داده معتبر از آن ها است. برای این منظور در این مقاله سیستمی خودکار برای ایجاد پایگاه داده از تصاویر موجود در مدارک علمی فارسی در مقیاس بزرگ ارائه می شود. این سیستم پیشنهادی در نتیجه مطالعات اسنادی طراحی شده و بخش های مختلفی دارد. در مرحله اول باید تصاویر و توضیح متنی آن ها استخراج گردد. به طور کلی دو رویکرد برای استخراج تصاویر و توضیح متنی آن ها از فایل وجود دارد. در رویکرد اول فایل به تصویر تبدیل می شود و از تکنیک های پردازش تصویر برای استخراج اطلاعات گرافیکی استفاده می شود. رویکرد دوم بر اساس پردازش ساختار و آرایش خود فایل است. از آنجایی که روش دوم از لحاظ سرعت و قابلیت مقیاس پذیری برای استفاده در موتورهای جستجو مناسب تر است، تمرکز این مقاله بر روی روش دوم است. بدین ترتیب برای استخراج تصاویر و توضیح متنی آن ها از یک روش ساختار محور استفاده می شود که مبتنی بر چیدمان و آرایش فایل ورد سند است. در نتیجه، مجموعه ای از تصاویر به همراه توضیحات و اطلاعات مربوط به آن ها به دست می آید که باید در یک پایگاه داده تصاویر با ساختاری مشخص ذخیره گردند. سپس این اطلاعات برای بازیابی و استفاده های آتی در یک موتور جستجو نمایه خواهند شد. روش پیشنهادی در زبان برنامه نویسی پایتون پیاده سازی شد و برای ارزیابی کارایی آن از روش مرسوم پردازش فایل پی دی اف اسناد کمک گرفته شد. سپس روش پیشنهادی در یک مطالعه موردی در پایگاه اطلاعات علمی ایران (گنج) به کار گرفته شد. تعداد 150 مدرک علمی به تصادف از پایگاه گنج انتخاب شده و با کمک این دو روش مورد تجزیه و تحلیل قرار گرفت. بنا به یافته های پژوهش دیده می شود که استخراج اطلاعات متنی از فایل پی دی اف در زبان فارسی با چالش های زیادی روبرو است و نمی تواند خروجی مناسبی در این زمینه حاصل کند. از طرف دیگر میزان تصاویر نامطلوب تولید شده از فایل پی دی اف بسیار زیاد است که از کاربست پذیری آن در شرایط واقعی می کاهد. از این رو روش پیشنهادی به عنوان گزینه ای مناسب برای استخراج تصویر و توضیحات آن ها از اسناد علمی در زبان فارسی و ایجاد پایگاه داده از آن ها پیشنهاد می شود. روش پیشنهادی قادر است حدود 40 درصد تصاویر را همراه با زیرنویس مربوطه بدون خطا استخراج کند؛ که نسبت به روش پایه که قادر به استخراج 30 درصد از تصاویر است، کارآیی بهتری دارد.

۲.

استخراج هوشمند مرز فراداده و متن در پایان نامه های فارسی با رویکرد BA_SVM(مقاله علمی وزارت علوم)

نویسنده: محدثه رهنما سید محمدحسین هاشمی نژاد جلال الدین نصیری

منبع: پژوهشنامه پردازش و مدیریت اطلاعات دوره ۳۶ تابستان ۱۴۰۰ شماره ۴ (پیاپی ۱۰۶) ۱۱۵۹-۱۱۷۹

کلیدواژه‌ها: استخراج فراداده استخراج اطلاعات ماشین بردار پشتیبان الگوریتم فرامکاشفهای الگوریتم خفاش

حوزه‌های تخصصی:

حوزه‌های تخصصی علم اطلاعات و دانش‌شناسی

تعداد بازدید : ۳۷۵ تعداد دانلود : ۵۰۵

استخراج فراداده باعث تسهیل در فرایند نمایه سازی و بهبود در بازیابی اطلاعات است. از سوی دیگر، خودکارسازی این فرایند سبب افزایش کارایی نسبت به استخراج دستی فراداده هاست. نام دانشجو، نام اساتید، عنوان، رشته و مقطع تحصیلی، چکیده، و کلمات کلیدی نمونه ای از فراداده های پایان نامه است. هدف در این مقاله شناسایی خودکار مرز فراداده و بدنه اصلی در پایان نامه های فارسی است. بدین منظور، 250 پایان نامه ثبت شده در سامانه «ایرانداک» جمع آوری شده است. ویژگی های مد نظر از هر پاراگراف استخراج شده و سپس، پاراگراف های پایان نامه با روش ماشین بردار پشتیبان به دو کلاس فراداده و بدنه طبقه بندی شد. در این پژوهش برای تنظیم پارامترهای الگوریتم ماشین بردار پشتیبان، الگوریتم فرامکاشفه ای خفاش به کار گرفته شده است. نتایج نشان می دهد که روش پیشنهادی با دقت 6/96 درصد نوع پاراگراف را تشخیص می دهد.

۳.

ارائه روشی برای برچسب زدن تصاویر موجود در متون علمی فارسی با استفاده از روش های پردازش متن(مقاله علمی وزارت علوم)

نویسنده: آزاده فخرزاده محدثه رهنما جلال الدین نصیری

منبع: پژوهشنامه پردازش و مدیریت اطلاعات دوره ۳۷ بهار ۱۴۰۱ شماره ۳ (پیاپی ۱۰۹) ۹۱۸-۸۹۵

کلیدواژه‌ها: برچسب زدن تصویر نشانه گذاری تصویر بازیابی تصویر پردازش متن استخراج فراداده فناوری اطلاعات

حوزه‌های تخصصی:

حوزه‌های تخصصی علم اطلاعات و دانش‌شناسی

تعداد بازدید : ۴۹۷ تعداد دانلود : ۳۲۰

در این مقاله یک روش جدید برای برچسب گذاری تصاویر موجود در متون علمی فارسی معرفی می شود. در اسناد و مقالات علمی، تصاویر حاوی اطلاعلات مهمی هستند و در بسیاری از موارد به تنهایی با بررسی آن ها می توان به ایده اصلی و یا نتایج مهم مقاله علمی پی برد، بدون اینکه لازم باشد کل مقاله را مطالعه کرد. به خاطر رشد روزافزون داده های تصویری، بازیابی تصاویر از اسناد علمی توجه زیادی را به خود جلب کرده و به یک موضوع روبه رشد در ادبیات تبدیل شده است. اولین قدم در بازیابی تصاویر تخصیص برچسب های توصیف کننده به هر تصویر است. در اینجا برای استخراج برچسب تصویر از متن سندی که تصویر به آن تعلق دارد، استفاده شده است. زیرنویس و قسمتی از متن سند که در آن به تصویر مورد نظر اشاره شده است، در نظر گرفته می شود. عبارات اسمی در متنِ همراه تصویر با استفاده از پنج روش متفاوتِ فراوانی عبارات در سند، معکوس فراوانی سند، فراوانی کلمه-معکوس فراوانی سند، شباهت کسینوسی عبارات با زیرنویس، و ترکیب روش فراوانی کلمه-معکوس فراوانی سند و شباهت کسینوسی با زیرنویس رتبه بندی می شوند. در هر روش، برچسب های انتخابی برای تصویر، عبارات اسمی با رتبه بالاتر در آن روش است. روش های معرفی شده با استفاده از داده آزمایشی از پایگاه اطلاعات علمی ایران (گنج) که منبع اصلی اسناد علمی فارسی است، ارزیابی می شوند. طبق نتایج به دست آمده در این تحقیق روش فراوانی کلمه-معکوس فراوانی سند بهترین روش برای برچسب زدن تصاویرموجود در اسناد علمی است.