چالش شمارش دادهها در هوش مصنوعی؛ چرا مدلها در ریاضیات ساده خطا میکنند؟
بررسی دلایل فنی خطای مدلهای هوش مصنوعی در ریاضیات ساده و شمارش ردیفها؛ تفاوت دقت ابزارهای شمارشگر با لیستهای خام و هزینه توکن در استدلال CoT.
بسیاری از کاربران تصور میکنند وقتی یک مدل هوش مصنوعی به پایگاه داده یا لیستی از اطلاعات دسترسی دارد، شمارش تعداد ردیفها سادهترین کار ممکن برای آن است. اما واقعیت فنی پیچیدهتر از این حرفهاست. نتایج یک بنچمارک جدید در کگل (Kaggle) نشان میدهد که نحوه ارائه داده به هوش مصنوعی، تفاوت فاحشی در دقت و هزینه نهایی ایجاد میکند. در این آزمایش، ۶۸ سوال مختلف از ۱۰ مدل مطرح بینالمللی پرسیده شد تا مشخص شود کدامیک در شمارش خروجی ابزارها بهتر عمل میکنند.
تفاوت ابزار شمارشگر با لیست خام
در طراحی ایجنتهای هوش مصنوعی، معمولاً دو راه برای پاسخ به سوالات کمی وجود دارد. در روش اول، ابزاری طراحی میشود که مستقیماً عدد نهایی (تعداد ردیفها) را برمیگرداند. در روش دوم، ابزار لیست کاملی از شناسهها یا ردیفها را در اختیار مدل قرار میدهد و مدل باید خودش آنها را بشمارد. نتایج نشان داد که وقتی ابزار مستقیماً عدد را میدهد، تمامی مدلها بدون استثنا و با کمترین هزینه ممکن، پاسخ درست را اعلام کردند. اما فاجعه زمانی رخ داد که مدلها مجبور شدند خودشان ردیفها را بشمارند.
فرض کنید در یک سیستم اتوماسیون اداری در ایران، از هوش مصنوعی میخواهید تعداد نامههای وارده در روز گذشته را شمارش کند. اگر سیستم لیست ۱۰۰ نامه را به مدل بدهد تا بشمارد، احتمال خطا به شدت بالا میرود. اما اگر ابزاری برای شمارش مستقیم در زیرساخت تعبیه شده باشد، دقت ۱۰۰ درصد خواهد بود.
هزینه سنگین استدلال برای شمارش
مدلهایی که سعی کردند با بررسی تکتک شناسهها (ID) به عدد درست برسند، موفق شدند ۳۳۰ شناسه را به درستی شناسایی کنند. اما این دقت به قیمت گزافی به دست آمد. این مدلها بین ۶ تا ۲۶ برابر بیشتر از حالت عادی توکن مصرف کردند. در مقابل، مدلهایی که سعی کردند بلافاصله و بدون استدلال گامبهگام پاسخ بدهند، در اکثر موارد شکست خوردند و از ۲۱ مورد تنها بین ۰ تا ۱۰ پاسخ صحیح دادند.
این موضوع نشان میدهد که هوش مصنوعی برای دقیق بودن در کارهای سادهای مثل شمارش، نیاز به «فکر کردن» روی کاغذ سفید (Chain of Thought) دارد که به معنای مصرف توکن بیشتر و در نتیجه هزینه بالاتر برای کاربر است. در پلتفرمهایی مانند هوش مصنوعی نهال که دسترسی تومانی به مدلهای بینالمللی فراهم شده است، بهینهسازی این فرآیندها میتواند هزینههای عملیاتی شرکتها را به شکل قابل توجهی کاهش دهد.
چرا مدلهای بزرگ در شمارش ضعیف هستند؟
ساختار مدلهای زبانی بزرگ برای پیشبینی کلمه بعدی طراحی شده است، نه برای انجام عملیات ریاضی دقیق روی دادههای حجیم. وقتی یک لیست طولانی از ردیفها به پنجره بافت (Context Window) مدل وارد میشود، مدل ممکن است دچار پدیده «گم شدن در میان متن» شود. در این حالت، بخشهایی از لیست نادیده گرفته میشوند یا تکراری شمرده میشوند.
راهکارهای بهبود دقت در ایجنتها
برای جلوگیری از این خطاها و کاهش هزینهها، توسعهدهندگان باید به جای تکیه بر توانایی شمارش خود مدل، از ابزارهای جانبی استفاده کنند. چند راهکار کلیدی عبارتند از:
۱. استفاده از توابع کمکی (Helper Functions) که خروجی را پیش از ارسال به مدل، پردازش و خلاصه میکنند. ۲. محدود کردن طول لیستهای ارسالی به مدل. ۳. وادار کردن مدل به استفاده از کدنویسی (مثل اجرای یک قطعه کد پایتون) برای شمارش ردیفها.
نتیجهگیری در طراحی دستیارهای هوشمند
اگر به دنبال ساخت دستیار هوش مصنوعی برای سازمان خود هستید، باید بدانید که هوش مصنوعی در نقش یک مدیر استدلالگر عالی است اما در نقش یک ماشینحساب ساده ممکن است شما را ناامید کند. بهترین استراتژی، ترکیب قدرت تحلیل مدلهای بزرگ با دقت ابزارهای سنتی است. با استفاده از زیرساخت هوش مصنوعی نهال، میتوانید ایجنتهایی بسازید که به جای مصرف بیهوده توکن برای شمارش دستی، از ابزارهای دقیق برای ارائه گزارشهای آماری استفاده کنند.
منبع: dev.to