امروز: ۱۴۰۵/۰۵/۰۳
فارسی
مقاله های روز

تلفیق هوش مصنوعی و علم آرشیو

کد خبر: ۶۰۱۴۰۱۴۰۵/۰۵/۰۳منبع: لیزنا
تلفیق هوش مصنوعی و علم آرشیو

المیرا سفیان

لیزنا؛ المیرا سفیان، دانشجوی دکتری مدیریت اطلاعات دانشگاه تبریزتحول دیجیتال در دهه‌های اخیر موجب دگرگونی عمیق در کارکرد و مأموریت آرشیوها شده است؛ به‌گونه‌ای که این نهادها از مخازن سنتی نگهداری اسناد به سامانه‌های هوشمند مدیریت، تحلیل و ارائه خدمات اطلاعاتی تبدیل شده‌اند. رشد شتابان حجم داده‌ها، تنوع قالب‌های اطلاعاتی و نیاز پژوهشگران به تحلیل عمیق محتوا سبب شده است که بهره‌گیری از فناوری‌های نوینی همچون یادگیری ماشین، یادگیری عمیق، پردازش زبان طبیعی و وب‌اسکریپینگ در مدیریت آرشیوهای دیجیتال ضرورتی اجتناب‌ناپذیر باشد. یکی از حوزه‌هایی که بهره‌گیری از این فناوری‌ها در آن اهمیت ویژه‌ای یافته، مطالعه و تحلیل کتیبه‌ها و اسناد تاریخی است. کتیبه‌ها به‌عنوان منابع اصیل تاریخی، اطلاعات ارزشمندی درباره ساختارهای سیاسی، فرهنگی، اجتماعی و زبانی جوامع گذشته ارائه می‌کنند؛ اما خوانش و تفسیر آن‌ها همواره با چالش‌هایی مانند فرسودگی فیزیکی، تفاوت‌های رسم‌الخطی، تغییرات زبانی و پیچیدگی نگارش روبه‌رو بوده است.

ترکیب روش‌های پردازش زبان طبیعی با فناوری‌های بینایی ماشین و OCR امکان بازخوانی دیجیتال متون کتیبه‌ها و استخراج داده‌های معنایی را فراهم کرده و مسیر تحلیل علمی این متون را هموار می‌سازد. این مقاله با رویکردی تحلیلی و کاربردی، ظرفیت‌ها و کاربردهای فناوری‌های نوین در توسعه سامانه‌های آرشیو دیجیتال و تحلیل متون تاریخی را بررسی می‌کند. در این چارچوب، فرآیندهایی همچون گردآوری داده‌ها، دیجیتال‌سازی اسناد، استخراج خودکار اطلاعات، تولید متاداده استاندارد، طبقه‌بندی هوشمند و جست‌وجوی معنایی تحلیل می‌شوند. همچنین تأکید می‌شود که در طراحی سامانه‌های آرشیوی مبتنی بر هوش مصنوعی، رعایت اصول بنیادین علم آرشیو—به‌ویژه اصل اصالت (Authenticity) و منشأ (Provenance)—ضروری است، زیرا اعتبار، یکپارچگی و ارزش پژوهشی اسناد بر آن‌ها استوار است.

پژوهش‌های پیشین نشان می‌دهند که پردازش زبان طبیعی می‌تواند نقش مهمی در تحلیل متون تاریخی ایفا کند؛ از جمله، الگوریتم‌های تشخیص موجودیت نامدار قادرند نام اشخاص، مکان‌ها و رویدادهای تاریخی را استخراج کنند و مدل‌های عمیق مانند BERT و Transformer امکان تحلیل معنایی متون پیچیده را فراهم می‌سازند. در حوزه کتیبه‌شناسی نیز ترکیب فناوری‌های بینایی ماشین، OCR و مدل‌های زبانی به خوانش خودکار متون باستانی کمک کرده و امکان تحلیل مقایسه‌ای و ترسیم روابط تاریخی را ایجاد می‌کند. با وجود پیشرفت‌ها، چالش‌هایی مانند کمبود داده آموزشی، تنوع رسم‌الخط‌های کهن و پیچیدگی ساختارهای زبانی همچنان پابرجاست؛ ازاین‌رو توسعه سامانه‌های هوشمند که اصول آرشیوی را با فناوری‌های هوش مصنوعی تلفیق کنند، اهمیت فزاینده‌ای دارد.

وب‌اسکریپینگ به‌عنوان ابزاری برای توسعه آرشیو دیجیتال

در فرآیند توسعه آرشیوهای دیجیتال، وب‌اسکریپینگ به‌عنوان یکی از روش‌های مؤثر برای گردآوری خودکار داده‌ها از منابع آنلاین مورد استفاده قرار می‌گیرد. این فناوری امکان استخراج ساخت‌یافته اطلاعاتی مانند تصاویر، توضیحات و متاداده‌های مرتبط با آثار فرهنگی را از وب‌سایت‌ها فراهم می‌کند. به‌عنوان نمونه، در حوزه مطالعات هنرهای سنتی ایران می‌توان از وب‌اسکریپینگ برای جمع‌آوری تصاویر فرش‌های ایرانی از پایگاه‌های اینترنتی، موزه‌ها و گالری‌های دیجیتال بهره برد. تصاویر گردآوری‌شده همراه با اطلاعاتی نظیر نام فرش، محل تولید، طرح و منبع وب در یک سامانه آرشیو دیجیتال ذخیره می‌شوند. این فرآیند نه‌تنها دسترسی پژوهشگران به داده‌های بصری را تسهیل می‌کند، بلکه امکان تحلیل‌های بعدی مانند طبقه‌بندی طرح‌ها، تشخیص الگوهای هنری و مقایسه سبک‌های بافت در مناطق مختلف ایران را نیز فراهم می‌سازد.

در این قطعه‌کد، یک فرآیند وب‌اسکریپینگ ساده برای جمع‌آوری خودکار تصاویر فرش ایرانی اجرا شده است. ابتدا محتوای صفحه‌ی وب موردنظر دریافت و با استفاده از BeautifulSoup تحلیل می‌شود تا تگ‌های تصویر در آن شناسایی گردد. سپس یک پوشه با نام rug_archive ایجاد می‌شود و پنج تصویر اول یافت‌شده در صفحه استخراج و دانلود می‌گردند. هر تصویر با ارسال یک درخواست HTTP دریافت شده و با نام‌های منظم rug_0، rug_1 و … در آرشیو دیجیتال محلی ذخیره می‌شود. در نهایت، این فرآیند مجموعه‌ای از تصاویر را از وب‌سایت گرفته، آن‌ها را سامان‌دهی کرده و در قالب یک آرشیو دیجیتال قابل‌استفاده برای پژوهش‌های بعدی ذخیره می‌کند.

پردازش خودکار اسناد اداری آرشیوی با استفاده از OCR و مدل‌های بینایی ماشین

پردازش خودکار اسناد اداری آرشیوی با استفاده از OCR و مدل‌های بینایی رایانه‌ای، امکان استخراج سریع و دقیق محتوای متنی از اسناد اسکن‌شده را فراهم می‌کند و فرایند دیجیتال‌سازی را به‌طور چشمگیری بهبود می‌بخشد. در این رویکرد، تصویر سند ابتدا با روش‌های ساده‌ی پیش‌پردازش مانند حذف نویز و افزایش کنتراست آماده می‌شود و سپس موتورهای OCR مخصوص زبان فارسی متن را تشخیص می‌دهند. پس از آن، با کمک مدل‌های بینایی رایانه‌ای و ابزارهای NLP، متن استخراج‌شده نرمال‌سازی، ساختاردهی و به داده‌های قابل جستجو تبدیل می‌شود. نتیجه این فرایند، افزایش کارایی آرشیو، امکان تحلیل محتوایی، و فراهم شدن دسترسی سریع به اطلاعات اداری و تاریخی است. در این مثال، یک سند اداری آرشیوی به‌عنوان نمونه مورد پردازش قرار می‌گیرد تا مراحل تبدیل تصویر به متن قابل تحلیل نشان داده شود.


استانداردهای آرشیوی (PREMIS, METS, Dublin Core)

در یک سامانه آرشیو دیجیتال هوشمند، متاداده باید مطابق استانداردهای بین‌المللی همچون Dublin Core، METS و PREMIS ذخیره شود تا یکپارچگی توصیف، قابلیت تبادل داده و ماندگاری طولانی‌مدت تضمین گردد. Dublin Core برای توصیف محتوایی (عنوان، پدیدآور، تاریخ)، METS برای ساختاردهی بسته دیجیتال (فایل‌ها، بخش‌ها، توصیفات)، و PREMIS برای ثبت اطلاعات حفاظتی مانند تاریخچه مالکیت، رویدادهای ویرایش و تغییرات به‌کار می‌رود. پایبندی به این استانداردها باعث می‌شود منشأ، مسیر انتقال و اصالت سندحفظ شود؛ این دو رکن اصلی آرشیو هستند زیرا بدون آن‌ها اسناد قابلیت استناد ندارند. از سوی دیگر، هوش مصنوعی نقش کلیدی در تولید خودکار متاداده عمیق‌تر مانند استخراج موجودیت‌ها، تشخیص موضوع، طبقه‌بندی سند، استخراج تاریخ‌ها، روابط میان افراد و حتی تولید خلاصه و کلیدواژه‌ها. ترکیب استانداردهای آرشیوی با هوش مصنوعی، سامانه‌ای می‌سازد که هم اصالت اسناد را حفظ می‌کند و هم متاداده غنی و قابل جستجو ارائه می‌دهد.


در خروجی این کد، یک رکورد آرشیوی استاندارد به‌صورت JSON تولید می‌شود که شامل چهار بخش اصلی است. در بخش Dublin Core، اطلاعات توصیفی مانند عنوان «گزارش ارتباطات»، نام پدیدآور (وزارت ارتباطات)، تاریخ ۱۴۰۲۰۵۱۰ و توضیح کامل متن قرار می‌گیرد. در بخش PREMIS یک هش SHA256 از متن ذخیره شده که برای تأیید اصالت سند و جلوگیری از هرگونه تغییر استفاده می‌شود، همراه با تاریخ ورود سند به آرشیو و نوع رویداد (دیجیتالی‌سازی). در بخش METS ویژگی‌های فنی فایل، مثل نوع آن (متن) و اندازه محتوا ثبت می‌شود. در بخش AI نیز یک بردار embedding معنایی قرار دارد که با استفاده از مدل SentenceTransformer تولید شده و امکان جست‌وجوی معنایی، خوشه‌بندی و تحلیل محتوایی را فراهم می‌کند. این فایل در نهایت با نام archive_record.json ذخیره می‌شود و یک رکورد کامل، قابل‌رهگیری و استاندارد برای آرشیو دیجیتال ایجاد می‌کند.

گراف دانش (Knowledge Graph) برای اسناد تاریخی

در آرشیو اسناد تاریخی، گراف دانش (Knowledge Graph) روشی قدرتمند برای نمایش ارتباطات میان اشخاص، مکان‌ها، رویدادها، تاریخ‌ها و اشیای فرهنگی است. در این رویکرد، هر سند تنها یک فایل منفرد نیست، بلکه مجموعه‌ای از «گره‌ها» و «روابط» است که معنا و زمینه تاریخی را روشن می‌کنند. برای مثال، از یک سند قدیمی می‌توان موجودیت‌هایی مانند «نویسنده»، «گیرنده»، «تاریخ»، «محل صدور»، «موضوع» و «نوع واقعه» استخراج کرد و سپس با استفاده از تکنیک‌های پردازش زبان طبیعی (NER + Relation Extraction) این عناصر را به‌صورت یک شبکه معنایی در کنار اسناد دیگر قرار داد. نتیجه این است که پژوهشگر می‌تواند مسیر زمانی یک شخص، روابط میان خاندان‌ها، شبکه ارتباطات اداری، یا مسیر تحول یک موضوع تاریخی را در قالب یک شبکه قابل کاوش ببیند. این روش باعث افزایش قابلیت جست‌وجوی معنایی، کشف الگوهای پنهان، و بازسازی زنجیره Provenance در آرشیوهای بزرگ می‌شود.


احراز اصالت و سلامت اسناد با بلاک‌چین یا Hash Chain

احراز اصالت و سلامت اسناد در آرشیو دیجیتال امروزی به‌عنوان یکی از مهم‌ترین لایه‌های اعتماد مطرح است. در این رویکرد، برای هر سند یک هش یکتا معمولاً با الگوریتم‌هایی مانند SHA256 تولید می‌شود تا کوچک‌ترین تغییر در محتوا قابل تشخیص باشد. سپس این هش می‌تواند در یک بلاک‌چین خصوصی (Private Ledger) یا عمومی ثبت شود تا زنجیره‌ای غیرقابل‌تحریف از Provenance ایجاد شود. به‌این‌ترتیب، هر مرحله از چرخه حیات سند—از دیجیتالی‌سازی تا ویرایش، انتقال و بازبایگانی—به‌صورت شفاف و دائمی ثبت می‌شود. ترکیب هش‌گذاری و بلاک‌چین نه‌تنها امکان تشخیص جعل دیجیتال و تغییرات غیرمجاز را فراهم می‌کند، بلکه اعتمادپذیری آرشیو را افزایش داده و زمینه‌ای قابل‌پیگیری برای سنجش صحت و تمامیت اسناد فراهم می‌سازد. این روش در آرشیوهای دولتی، حقوقی، تاریخی و امنیتی به‌سرعت در حال تبدیل‌شدن به یک استاندارد جدید است.

کلام آخر

نتایج بررسی‌ها نشان می‌دهد که تلفیق هوش مصنوعی و علم آرشیو نه‌تنها موجب ارتقای کیفیت مدیریت منابع اطلاعاتی می‌شود، بلکه امکان تحلیل عمیق‌تر، دقیق‌تر و گسترده‌تری از اسناد تاریخی و اداری را نیز فراهم می‌آورد. فناوری‌هایی همچون پردازش زبان طبیعی، OCR، وب‌اسکریپینگ و مدل‌های زبانی پیشرفته، ابزارهایی توانمند برای دیجیتال‌سازی اسناد، استخراج داده، تولید متاداده غنی و سازمان‌دهی هوشمند مجموعه‌ها هستند. همچنین بهره‌گیری از رویکردهایی مانند گراف دانش و بلاک‌چین سبب افزایش شفافیت، حفظ اصالت، تقویت مسیر منشأ (Provenance) و ایجاد قابلیت ردیابی در کل چرخه حیات اسناد می‌شود.

ترکیب اصول بنیادین آرشیوی با توانمندی‌های هوش مصنوعی به شکل‌گیری نسل جدیدی از آرشیوهای دیجیتال منجر می‌شود؛ آرشیوهایی که نه‌تنها نقش سنتی صیانت از حافظه جمعی را برعهده دارند، بلکه بستر تحلیل داده‌محور، کشف الگوهای پنهان و تولید دانش جدید را نیز فراهم می‌کنند. بنابراین، آینده مدیریت اسناد و میراث تاریخی را نمی‌توان بدون بهره‌گیری از فناوری‌های هوش مصنوعی تصور کرد و توسعه سامانه‌های آرشیوی هوشمند به‌مثابه گامی اساسی در ارتقای پژوهش‌های تاریخی، مستندسازی دیجیتال و خدمات اطلاعاتی شناخته می‌شود.

در این میان، حوزه کتابداری و علم اطلاعات بیش از بسیاری از رشته‌های علوم انسانی ظرفیت همگام‌سازی با ابزارهای هوش مصنوعی را دارد؛ زیرا ماهیت داده‌محور، ساختارمند و فرایندمحور این رشته آن را در موقعیتی ممتاز برای بهره‌گیری از فناوری‌های نوین قرار می‌دهد. این ویژگی سبب شده است کتابداری و آرشیو بتوانند به‌سرعت خود را با تحولات فناورانه سازگار کرده و به الگوهایی عملی برای توسعه سامانه‌های هوشمند مدیریت دانش و اطلاعات تبدیل شوند.

منابع

بابائی، سیروان. (۱۴۰۴). کاربرد هوش مصنوعی در بازخوانی و تحلیل اسناد تاریخی. در نخستین کنفرانس بین‌المللی آموزش نوآورانه: پیوند روان‌شناسی و تعلیم و تربیت برای تحول آموزشی.

باغستانی، ساناز، خسروی، فریبرز، و نشاط، نرگس. (۱۳۸۹). تنظیم، پاسداشت منشأ و حفظ نظم نخستین در آرشیو ملی ایران. گنجینه اسناد، شماره ۷۸، تابستان.

روزبهی، ر. (1399). بهینه‌سازی هش در فناوری بلاک چین جهت حفظ امنیت و حریم خصوصی در اینترنت اشیاء )پایان‌نامه کارشناسی ارشد، دانشگاه یزد(.

سعیدی‌زاده، م.ج. (1400). ارائه روشی برای پالایش گراف دانش به منظور بهبود کارایی جانمایی گراف دانش )پایان‌نامه کارشناسی ارشد، دانشگاه علم و صنعت ایران(.

مکتب‌خونه. آموزش وب اسکرپینگ با پایتون (Web Scraping). بازیابی‌شده از

https://maktabkhooneh.org

فرادرس. آموزش گراف دانش

https://blog.faradars.org/what-is-web-scraping

https://faradars.org/courses/fvsft122-graph-theory-and-applications

فرادرس آموزش بلاک چین

https://faradars.org/courses/blockchain-and-cryptocurrencies-with-jadi-fvfn443

دیدگاه کاربران

هنوز دیدگاهی برای این خبر منتشر نشده است.

ارسال دیدگاه

برای کاربران مهمان، قبل از ارسال برای بررسی، کد تایید پیامکی ارسال می‌شود.