از متن شلوغ جدول دربیاور؛ استخراج ساختاریافته با AI را قابلبررسی کن
چند ایمیل، رزومه یا سند داری و میخواهی نام، تاریخ، مبلغ یا وضعیت را به جدول تبدیل کنی بدون ورود دستی طولانی.
ستونها را قبل از استخراج تعریف کن، مقدار نامعلوم را خالی یا null نگه دار و برای هر ردیف شاهد متن اصلی بخواه تا مدل جاهای خالی را حدس نزند.
چطور دقیقتر به موضوع نگاه کنیم؟
- ستونها و نوع داده هر ستون را قبل از پردازش تعریف کن.
- قاعده بگذار: اگر مقدار در متن نیست، null یا «نامشخص» بنویسد و حدس نزند.
- یک ستون source/evidence برای جمله یا بخش مبنا اضافه کن.
- ابتدا 5 تا 10 نمونه را دستی بررسی کن؛ بعد سراغ batch بزرگتر برو.
چرا این موضوع مهم است؟
اگر schema مبهم باشد، مدل ممکن است ستونها را با تفسیر خودش پر یا داده ناقص را تکمیل کند. قرارداد خروجی روشن خطا را قابل مشاهده میکند.
سؤالهایی که معمولاً بعدش پیش میآید
JSON بهتر است یا جدول؟
برای پردازش ماشینی JSON و برای بازبینی انسانی جدول مناسبتر است؛ schema در هر دو مهم است.
چطور hallucination را کم کنم؟
قاعده عدم حدس، evidence و نمونهبرداری دستی سه کنترل عملیاند.
