منبع با پاسخ نهایی یکی نیست
فایل خام برای Provenance لازم است، اما متن خام لزوماً واحد مناسبی برای Retrieval و پاسخدهی نیست.
WORK / 03—KNOWLEDGE SYSTEMS
طراحی مدلی برای تبدیل مستندات، تجربه پشتیبانی و شواهد پراکنده به دانش ساختیافته و قابل بازیابی؛ به شکلی که هم منشأ هر پاسخ روشن بماند و هم Retrieval بتواند سؤال درست را به دانش درست برساند.
01 زمینه
وقتی دانش عملیاتی میان مستندات، تجربه افراد و سابقه پشتیبانی پخش است، اضافه کردن Vector Search بهتنهایی آن را به یک پایگاه دانش قابل اتکا تبدیل نمیکند.
برای پاسخ قابل اعتماد، باید قبل از Retrieval روشن شود چه چیزی واقعاً دانش معتبر است، مرز هر موضوع کجاست، چگونه منبع آن حفظ میشود و وقتی اطلاعات جدید میرسد باید Knowledge Item موجود بهروزرسانی شود یا مورد تازهای ساخته شود.
فایل خام برای Provenance لازم است، اما متن خام لزوماً واحد مناسبی برای Retrieval و پاسخدهی نیست.
Heading یا تعداد کاراکتر بهتنهایی مرز دانش را تعیین نمیکند؛ Topic و Intent باید مستقل و قابل فهم باقی بمانند.
ورود سند جدید نباید به تکثیر پاسخهای مشابه منجر شود؛ باید مشخص شود مورد جدید Update، Duplicate، New یا نیازمند Review است.
عنوان، Intent، کلیدواژه، سؤالهای محتمل و دامنه محصول باید به Recall کمک کنند، بدون اینکه واقعیت تازهای اختراع کنند.
02 نقش من
بخش اصلی کار، تعریف قرارداد داده و تصمیمهایی بود که مشخص میکنند یک منبع چگونه وارد Knowledge Base میشود، چه زمانی ادغام میشود و چه زمانی باید برای بازبینی متوقف شود.
این شامل تعریف Source of Truth، ساختار ثابت Knowledge Item، جداسازی دامنههای محصول، قواعد Metadata، Versioning محتوا و Match Gate برای جلوگیری از ایجاد دانش تکراری بود.
هدف این نبود که مدل «هر طور شد» پاسخی پیدا کند. هدف ساختن پایهای بود که بتوان درباره منشأ پاسخ، دامنه آن، نسخه فعلی دانش و دلیل انتخاب آن توسط Retrieval توضیح داد.
03 معماری دانش
فایل خام برای حفظ شواهد نگهداری میشود؛ نسخه Retrieval-ready با Schema مشخص ساخته میشود؛ و لایه Retrieval با استفاده از Metadata و شباهت معنایی، دانش مناسب را برای پاسخ پیدا میکند.
04 تصمیمها
چیزی که در منبع وجود ندارد نباید برای «کاملتر شدن» پاسخ ساخته شود. کمبود اطلاعات باید قابل تشخیص بماند، نه اینکه با حدس پوشانده شود.
مرز دانش بر اساس یک موضوع مستقل و قابل بازیابی تعیین میشود، نه صرفاً Heading فایل یا طول ثابت Chunk.
دانش مربوط به هر Line در فضای خودش نگهداری و بازیابی میشود و فقط دانش واقعاً مشترک وارد Shared Services میشود.
ID، ساختار و Metadata قرارداد ثابتی دارند؛ تغییر واقعی دانش Version را جلو میبرد، نه صرفاً تغییر Format یا جابهجایی متن.
قبل از Create یا Update، ورودی با دانش موجود مقایسه میشود تا Duplicate، Update و موضوع تازه از هم تفکیک شوند و موارد مبهم برای Review متوقف شوند.
05 مصالحهها
Item کوچک Retrieval را دقیقتر میکند، اما اگر بیش از حد خرد شود پاسخ برای فهم به چند Chunk وابسته میشود. مرز مناسب باید هر دو را حفظ کند.
Metadata و Question Variantها Recall را بالا میبرند، اما اگر بیش از حد عمومی باشند دانش نامرتبط وارد پاسخ میشود.
بخشی از جریان میتواند خودکار شود، اما Merge یا Create مبهم باید به Review برود تا سرعت باعث تخریب Source of Truth نشود.
06 خروجی
یک مدل نگهداری دانش شکل گرفت که بین منبع خام، نسخه فعلی دانش و نحوه بازیابی آن مرز روشن دارد و میتواند با ورود اطلاعات جدید بدون تکثیر بیقاعده رشد کند.
هر دانش نهایی به منبع و دامنه خودش متصل میماند و Provenance در فرآیند از بین نمیرود.
Knowledge Itemها ساختار ثابت و قابل ارزیابی دارند و برای سؤالهای مختلف بهصورت مستقل قابل فهماند.
دانش جدید میتواند بهجای ساخت Duplicate، Knowledge Item موجود را تکمیل و Version آن را بهروزرسانی کند.
Routing و جداسازی دامنهها احتمال بازیابی دانش از زمینه اشتباه را کاهش میدهد.
ساختار داده امکان ارزیابی Retrieval و اصلاح تدریجی Recall و Precision را فراهم میکند، بدون اینکه حقیقت منبع تغییر کند.
کیفیت دستیار با بیش از ۲۶۰۰ پرسش واقعی کاربران ارزیابی شد؛ بنابراین ارزیابی فقط بر نمونههای ساختگی یا دمو متکی نماند.
فناوریها و سازوکارها بهعنوان شواهد اجرا:
07 آموختهها
Embedding بهتر میتواند Retrieval را بهتر کند، اما نمیتواند مرز دانش مبهم، منبع نامعتبر یا پاسخهای تکراری و متناقض را بهتنهایی اصلاح کند.
وقتی پاسخ مشکل دارد، باید بتوان به منبع برگشت و تشخیص داد مسئله از محتوا، تبدیل دانش یا Retrieval آمده است.
Chunking تصمیم صرفاً فنی نیست؛ مرزبندی ضعیف میتواند حتی با مدل و Embedding خوب، پاسخ ناقص یا نامرتبط تولید کند.
Knowledge Base پایان یک Migration نیست. قواعد Update، Duplicate، Review و Versioning برای زنده ماندن آن به اندازه ساخت اولیه مهماند.
این مطالعه موردی در سطح روش، معماری دانش و تصمیمهای قابل انتقال نوشته شده است. محتوای واقعی دانش، شناسههای داخلی، تیکتها، مشتریان، جزئیات محصول و دادههای غیرعمومی عمداً حذف یا تعمیم داده شدهاند.
بازگشت به مجموعه