امروز: ۱۴۰۵/۰۵/۲۰
فارسی
مقاله های روز

گذر از انزوای داده‌ای: طراحی گراف دانش پیوندی برای منابع کتابشناختی فارسی بر پایه RDF

کد خبر: ۶۰۱۸۴تاریخ انتشار: ۱۴۰۵/۰۵/۲۰منبع: لیزنا
گذر از انزوای داده‌ای: طراحی گراف دانش پیوندی برای منابع کتابشناختی فارسی بر پایه RDF

المیرا سفیان

لیزنا؛ المیرا سفیان، دانشجوی دکتری مدیریت اطلاعات دانشگاه تبریز:

وب معنایی و تحول در سازماندهی دانش

در عصر کنونی، داده‌ها به عنوان اصلی‌ترین سرمایه‌های جوامع علمی و فرهنگی شناخته می‌شوند. با گسترش روزافزون تولید اطلاعات در فضای دیجیتال، چالش‌های مرتبط با سازماندهی، بازیابی و بهره‌مندی از این داده‌ها به یکی از دغدغه‌های اساسی جوامع علمی تبدیل شده است. در پاسخ به این چالش، رویکرد جدیدی در سازماندهی اطلاعات پدید آمد که با عنوان «وب معنایی» (Semantic Web) شناخته می‌شود. این مفهوم که نخستین بار توسط تیم برنرز لی (Tim Berners-Lee)، مخترع وب جهانی، در سال ۲۰۰۱ مطرح شد، بر این ایده استوار است که داده‌ها نه تنها باید برای انسان‌ها قابل خواندن باشند، بلکه باید برای ماشین‌ها نیز قابل درک و پردازش شوند

در پارادایم وب معنایی، دانش نه در قالب اسناد ایزوله و ایستا، بلکه به عنوان شبکه‌ای پویا از موجودیت‌های متصل (Linked Entities) تعریف می‌شود که از طریق روابط معنادار به یکدیگر پیوند می‌خورند. این تحول پارادایمی، کتابخانه‌ها و مراکز اطلاع‌رسانی را که از دیرباز متولی سازماندهی و اشاعه‌ی دانش بوده‌اند، با چالش‌ها و فرصت‌های نوینی مواجه ساخته است.

جایگاه داده‌های کتابشناختی فارسی در عصر وب معنایی

کتابخانه‌های ایران، با تکیه بر استانداردهای سنتی نظیر «ایران‌مارک» که دهه‌هاست که گنجینه‌ای از داده‌های کتابشناختی معتبر و ارزشمند تولید و انباشته کرده‌اند. این داده‌ها، که شامل اطلاعات دقیق و ساختاریافته‌ای در مورد کتاب‌ها، پدیدآورندگان، ناشران، موضوعات و سایر عناصر کتابشناختی است، به عنوان یکی از مهم‌ترین منابع اطلاعاتی در حوزه فرهنگ و تمدن ایران زمین محسوب می‌شود

با این حال، این گنجینه‌ی ارزشمند متأسفانه در «سیلوهای داده‌ای» محصور مانده است. ساختار بسته و وابسته به سامانه‌های خاص کتابخانه‌ای، مانع از آن شده است که این داده‌ها در فضای باز وب، به‌ویژه در موتورهای جست‌وجوی نوین و محیط‌های پژوهشی بین‌المللی، به‌درستی دیده شوند و مورد بهره‌برداری قرار گیرند. این انزوای داده‌ای نه‌تنها دسترسی پژوهشگران و کاربران به منابع علمی و فرهنگی ایران را محدود کرده، بلکه جایگاه این منابع را در سطح جهانی نیز تضعیف نموده است.

گذار به وب معنایی در منابع کتاب‌شناختی فارسی

این پژوهش بر مبنای اصول وب معنایی و نظریات تیم برنرز-لی طراحی شده است. هدف اصلی آن، ارتقای داده‌ها از سطح «دسترسی آزاد» به سطح «داده‌های پیوندی» است تا امکان تعامل هوشمند میان منابع اطلاعاتی فراهم شود. در این چارچوب، سه اصل محوری به‌عنوان مبنای نظری پروژه در نظر گرفته شده است:

  1. شناسایی موجودیت‌ها با URI: استفاده از شناسه‌های یکتای وب برای تمامی موجودیت‌ها، از جمله کتاب، پدیدآورنده و ناشر.
  2. به‌کارگیری استانداردهای باز: بهره‌گیری از مدل داده‌ای RDF و سریال‌سازی آن با قالب Turtle برای تضمین قابلیت تبادل داده.
  3. تضمین قابلیت پیوندپذیری: طراحی ساختاری که امکان اتصال این مخزن داده با سایر گراف‌های داده‌ای جهان را فراهم سازد.

در راستای تحقق این چارچوب نظری، یکی از دستاوردهای کلیدی این پروژه، طراحی و پیاده‌سازی نظام شناسایی اختصاصی برای منابع کتاب‌شناختی فارسی است. در نظام‌های کتابخانه‌ای سنتی، شناسه‌ها عمدتاً تنها در پایگاه داده داخلی همان سامانه معنا داشتند؛ اما در این پروژه، با تعریف URIهای محلی، گذار از «شناسه‌های وابسته به سیستم» به «شناسه‌های مستقل وب» صورت گرفته است. الگوی طراحی این شناسه‌ها به شکل زیر است:

http://127.0.0.1:5000/resource/{type}_{id}

این راهبرد عملیاتی، سه مزیت بنیادی برای ساختار اطلاعاتی کتابخانه‌های ایران به همراه دارد:

  • استقلال در سازماندهی: تولید URIهای محلی وابستگی داده‌های کتاب‌شناختی به فرمت‌های بسته و نرم‌افزارهای خاص کتابخانه‌ای را کاهش می‌دهد. هر رکورد اکنون به‌عنوان یک موجودیت مستقل در وب تعریف می‌شود که حتی خارج از بستر فعلی سامانه کتابخانه‌ای نیز قابل ارجاع و شناسایی است.
  • ایجاد زیرساختی مستحکم: پیش‌نیاز ورود به هرگونه تبادل داده در مقیاس جهانی، برخورداری از یک نظام داخلی منسجم و استاندارد است. این URIها حکم شناسنامه‌ی دیجیتال منابع را دارند و در شکل‌گیری گراف دانش ملی نقش ایفا می‌کنند؛ به‌گونه‌ای که هر کتاب جایگاه دقیق و قابل استنادی خواهد داشت.
  • رفع ابهام‌های داخلی: تخصیص هوشمندانه URI بر اساس شابک یا سایر شناسه‌های منحصربه‌فرد، مشکل تکرار داده یا ابهام در شناسایی را که سال‌ها گریبان‌گیر نظام‌های ایران‌مارک بوده، در سطح زیرساخت برطرف می‌سازد. این اقدام نوعی پالایش ساختاری است که پایه و اساس توسعه مدیریت دانش در آینده خواهد بود.

به بیان دیگر، این پروژه در حال بنا نهادن زیرساختی است که ستون‌های آن بر پایه وب معنایی شکل گرفته‌اند. این URIهای محلی، زیربنایی برای افزایش قابلیت کشف‌پذیری داده‌ها فراهم می‌کنند، بی‌آنکه در این مرحله نیازی به اتکا به استانداردهای خارجی وجود داشته باشد. این رویکرد، حرکتی مستقل و بومی در مسیر نوسازی سازماندهی اطلاعات در ایران به‌شمار می‌آید.

فرآیند نگاشت و تبدیل داده‌های ایران‌مارک به مدل RDF

داده‌های موجود در سامانه رسا ایران‌مارک به دلیل ساختار بسته و سنتی، برای محیط وب معنایی بهینه نیستند. برای گذار به وب معنایی، این داده‌ها باید از قالب متنی ایستا به قالب معنایی و پیوندی تغییر ماهیت دهند. در این پژوهش، فرآیند تبدیل شامل استخراج فیلدها و نگاشت دقیق آن‌ها بر اساس استانداردهای بین‌المللی همچون Schema.org بوده است.

در این مرحله، هر رکورد کتابشناختی به مجموعه‌ای از سه‌گانه‌های RDF شامل فاعل، رابطه و مفعول تبدیل شده است. انتخاب فرمت Turtle به دلیل خوانایی بالا برای انسان و ماشین، به عنوان روش سریال‌سازی نهایی برگزیده شد. این اقدام، زیربنای اصلی برای هوشمندسازی جستجو و ارتقای تجربه کاربر است. با تبدیل داده‌ها به مدل RDF، امکان برقراری پیوند منطقی میان موجودیت‌ها فراهم می‌شود؛ بدین ترتیب، سیستم نه تنها عنوان کتاب، بلکه روابط میان پدیدآورندگان، موضوعات و ناشران را نیز تحلیل می‌کند و خروجی‌های دقیق‌تری در اختیار جستجوگر قرار می‌دهد.

این رویکرد فنی، عملاً شکاف میان سیستم‌های کتابخانه‌ای کلاسیک و فناوری‌های نوین داده‌محور را از میان برداشته و بستری پایدار برای پیاده‌سازی چت‌بات‌های مبتنی بر دانش فراهم کرده است.

زیرساخت ذخیره‌سازی و مدیریت دانش (Triple Store)

برای مدیریت و اجرای پرس‌وجوهای پیچیده بر روی سه‌گانه‌های تولید شده، از یک مخزن داده‌یِ معنایی (Triple Store) استفاده شده است. این مخزن به عنوان هسته‌ی مرکزی پردازش، قابلیت میزبانی بیش از ۶۶ هزار سه‌گانه را فراهم آورده و از طریق «کنسول SPARQL»، امکان اجرای پرس‌وجوهای متنی و منطقی را برای کاربران و ابزارهای هوشمند جانبی ممکن می‌سازد. این زیرساخت با تجمیع موجودیت‌های کلیدی شامل ۴۹۴۵ کتاب، ۷۹۰۵ پدیدآور و ۱۳۰۹ ناشر، به یک «گراف دانش ملی» تبدیل شده که به واسطه‌ی زبان استاندارد SPARQL، دسترسی هوشمند به اطلاعات کتابشناختی را جایگزین جستجوهای ساده‌ی متنی کرده است. 

 فرآیند بازیابی دانش: از کوئری SPARQL تا نمایش موجودیت

یکی از دستاوردهای کلیدی این سامانه، جایگزینی روش های جستجوی سنتی (که صرفاً بر تطبیق رشته ای کاراکترها استوار بودند) با «جستجوی معنایی» بر اساس سه‌گانه‌های RDF است.

هنگامی که کاربر شابک مشخص (مثلاً 9786227278552) را در کنسول SPARQL جستجو می کند، موتور پرس و جو به جای جستجو در یک جدول ساده، گراف دانش پروژه را پیمایش کرده و موجودیت schema:Book مرتبط با آن شابک را شناسایی می کند. این جستجو بلافاصله منجر به بازیابی مجموعه ای از ویژگی های مرتبط (شامل عنوان، ناشر، سال انتشار و مکان) و ارجاع هوشمند به موجودیت دیگر، یعنی نویسنده (schema:Person) می شود.

مزیت عملیاتی:

در تصاویر پیوست، مشاهده می شود که با کلیک بر روی نام نویسنده (محمدرضا خسروی)، سامانه به جای نمایش یک صفحه ایستا، به URI اختصاصی آن شخص (یعنی .../agent/1) هدایت می شود. این «ارتباط معنادار» میان کتاب و پدیدآور، ویژگی متمایز سامانه های وب معنایی است که در این پروژه به شکلی بومی سازی شده برای داده های کتابخانه ای فارسی پیاده سازی شده است. این ساختار، نه تنها مسیر بازیابی اطلاعات را کوتاه تر کرده، بلکه زمینه ساز پیاده سازی «چت بات های هوشمند کتابخانه ای» است که می توانند روابط پیچیده میان پدیدآورندگان و آثارشان را به زبان طبیعی برای کاربر تفسیر کنند. 

کاربرد چت بات در ساده سازی پرس وجوهای کتابشناختی مبتنی بر SPARQL

از آن جا که نگارش پرس وجوهای SPARQL برای بسیاری از کاربران عادی پیچیده و تخصصی است، در این پروژه چت باتی هوشمند طراحی شد تا فرایند جست وجو در مخزن داده های کتابشناختی را به سطحی ساده تر و کاربرپسندتر ارتقا دهد. این چت بات با دریافت پرسش های طبیعی به زبان فارسی یا انگلیسی، نیاز کاربر را به صورت مفهومی دریافت کرده و آن را به ساختارهای قابل پردازش در لایه داده های پیوندی تبدیل می کند. به این ترتیب، کاربر بدون آشنایی با نحو فنی SPARQL می تواند تنها با بیان نیاز اطلاعاتی خود، به منابع کتابخانه ای مرتبط دسترسی پیدا کند.

این رویکرد، علاوه بر کاهش پیچیدگی تعامل با سامانه، موجب افزایش دسترسی پذیری، بهبود تجربه کاربری، و گسترش قابلیت کشف منابع کتابخانه ای می شود. همچنین نمایش نتایج در قالب جدول های کتابشناختی شامل عنوان، پدیدآور، ناشر، سال نشر و URI، ضمن حفظ ساختار معنایی داده ها، امکان مشاهده و ارزیابی سریع اطلاعات را برای کاربر فراهم می سازد. 

 

نمونه عملی: سرویس SPARQL کتابخانه ملی آلمان (DNB)

در نمونه کتابخانه ملی آلمان، سرویس DNB SPARQL Service امکان دسترسی معنایی به داده های مستند GND را فراهم می کند و کاربر را قادر می سازد تا با بهره گیری از پیشوندهای استانداردی مانند gnd و gndo، روابط پیچیده میان اشخاص، حرفه ها و شناسه های مستند را بازیابی کند (image.png، بخش میانی و پایین تصویر). وجود قابلیت هایی مانند Execute، Download و Format نشان می دهد که این سامانه صرفا یک رابط جست وجوی ساده نیست، بلکه یک زیرساخت عملی برای پرس وجوی معنایی، استخراج داده و استفاده پژوهشی از رکوردهای کتابشناختی است. از منظر این پژوهش، چنین مدلی برای پروژه لینک دیتای کتابشناختی فارسی اهمیت ویژه دارد، زیرا نشان می دهد که تبدیل داده های کتابشناختی به قالب RDF و فراهم کردن امکان پرس وجوی SPARQL، می تواند هم به حل مسئله ابهام در شناسایی موجودیت ها کمک کند و هم دسترسی پژوهشگران را به اطلاعات ساخت یافته و استاندارد تسهیل نماید. به این ترتیب، تجربه DNB یک الگوی تطبیقی معتبر برای طراحی زیرساخت معنایی کتاب من، به ویژه در حوزه نمایش موجودیت ها، پیوندهای مفهومی و بازیابی پیشرفته اطلاعات، به شمار می رود.

 

نتیجه‌گیری: گذار از انزوای داده‌ای ایران به هم‌پیوندی جهانی با رویکرد داده‌های پیوندی

پروژه «لینک‌دیتای کتابشناختی فارسی» با محوریت تبدیل داده‌های ایران‌مارک به گراف دانش استاندارد، پاسخی علمی و عملی به چالش‌های اساسی موجود در دسترسی‌پذیری و رویت‌پذیری منابع علمی و فرهنگی ایران در عصر وب معنایی است. همان‌طور که در متن مقالات ذکر شد، نظام‌های سنتی کتابخانه‌ای ایران، علی‌رغم غنای اطلاعاتی، به دلیل ساختار بسته و عدم انطباق با استانداردهای جهانی URI و RDF، در «سیلوهای داده‌ای» محصور مانده‌اند. این امر، به‌ویژه در مواجهه با مسائلی چون عدم امکان اتصال شابک، ISSN و سایر شناسه‌های ملی به URIهای جهانی، و همچنین دشواری در تبدیل رکوردهای ایران‌مارک به مدل‌های داده‌ای مدرن مانند RDA، منجر به انزوای منابع فارسی در محیط‌های تحقیقاتی بین‌المللی و محدودیت تعامل هوشمند با آن‌ها شده است.

رویکرد این پروژه، با تعریف URIهای محلی مستقل از سیستم و استفاده از استانداردهای باز (RDF و Turtle)، بنیاد یک «گراف دانش ملی» را بنا نهاده است. این گام اساسی، ضمن رفع ابهام‌های داخلی و ایجاد زیرساختی مستحکم، داده‌های کتابشناختی ایران را به موجودیت‌های قابل کشف و پیوندپذیر در وب تبدیل می‌کند. این امر، امکان هم‌پیوندسازی (Interlinking) داده‌های فارسی را با سایر گراف‌های دانش جهانی فراهم می‌آورد، حتی اگر در گام اول، این پیوندها از طریق URIهای محلی صورت پذیرد.

همان‌طور که نمونه‌های عملی DNB نشان می‌دهند، تبدیل داده‌ها به RDF و فراهم کردن امکان پرس‌وجوی معنایی از طریق SPARQL، مزایای بنیادینی دارد:

  • حل مسئله ابهام موجودیت‌ها: تخصیص URI منحصربه‌فرد به هر کتاب، پدیدآور و ناشر، مشکل تکرار و ابهام داده‌ای را که سال‌ها گریبان‌گیر سیستم‌های سنتی بوده، در سطح زیرساخت حل می‌کند.
  • تسهیل بازیابی پیشرفته: جستجوی معنایی مبتنی بر سه‌گانه‌های RDF، فراتر از تطبیق رشته‌ای، روابط منطقی میان موجودیت‌ها را درک کرده و امکان بازیابی دقیق‌تر و هوشمندانه‌تر اطلاعات را فراهم می‌آورد.
  • افزایش دسترسی‌پذیری: طراحی چت‌بات هوشمند، پیچیدگی پرس‌وجوهای SPARQL را برای کاربران عادی پنهان کرده و با دریافت پرسش به زبان طبیعی، دسترسی به منابع کتابخانه‌ای را به طرز چشمگیری بهبود می‌بخشد.

در نهایت، این پروژه نه تنها یک «مدل اجرایی» برای مدرن‌سازی سازماندهی اطلاعات در ایران ارائه می‌دهد، بلکه اثبات می‌کند که حتی با وجود چالش‌های مربوط به زیرساخت‌های شناسایی بین‌المللی، می‌توان با اتکا به اصول وب معنایی و استانداردهای باز، داده‌های فرهنگی و علمی کشور را به شکلی استاندارد، مستقل و آماده برای پیوند در دنیای جهانی داده‌های پیوندی، سازماندهی و مدیریت کرد. این رویکرد، گامی حیاتی در جهت ارتقای رویت‌پذیری و دسترسی‌پذیری میراث دانش فارسی در سطح جهانی محسوب می‌شود.

Eslami, S., & Vaghefzadeh, M. H. (2013). Publishing Persian Linked data of National library and Archive of IRANIFLA World Library and Information Congress

Fathian Dastgerdi, A., Taheri, S. M., Sanatjoo, A., & Kahani, M. (2020). Implementation of Linked Data Method in Library Systems: Analyzing the Required Components and Providing a PatternJournal of Knowledge Retrieval and Semantic Systems (JKRS)

Shirmardi, F., Hosseini, S. M. H., & Momtazi, S. (2021). FarsWikiKG: An automatically constructed knowledge graph for Persian. International Journal of Web Research, *4*(2), 25–30. https://doi.org/10.22133/ijwr.2022.337760.1112

Eslami, S., & Vaghefzadeh, M. H. (2013). Publishing Persian linked data of National library and Archive of IRAN. IFLA World Library and Information Congres

دیدگاه کاربران

هنوز دیدگاهی برای این خبر منتشر نشده است.

ارسال دیدگاه

برای کاربران مهمان، قبل از ارسال برای بررسی، کد تایید پیامکی ارسال می‌شود.