۱۴ شهریور ۱۴۰۵

FiMI بانکی با پاداش قابل‌راستی‌آزمایی، در وظایف خودش از مدل ۱۲ میلیاردی جلو می‌زند

FiMI بانکی با پاداش قابل‌راستی‌آزمایی، در وظایف خودش از مدل ۱۲ میلیاردی جلو می‌زند

پژوهش تازه FiMI Banking از تیم هوش مصنوعی NPCI یک ادعای عملی برای هوش مصنوعی مالی دارد: مدل ۴٫۵ میلیاردپارامتری در محیط بانکی بازپخش‌پذیر آموزش دید و امتیاز آزمون نگه‌داشته‌شده را از ۰٫۶۱۰ به ۰٫۶۹۷ رساند؛ کمی بالاتر از ۰٫۶۹۰ مدل پایه ۱۲ میلیاردپارامتری، آن هم با ۲۹ درصد توکن خروجی کمتر در هر گفت‌وگو. این نتیجه برتری عمومی مدل کوچک را ثابت نمی‌کند. آزمون فقط هزار وظیفه مصنوعی بانکداری خرد هند با ابزار، وضعیت حساب و پاداش ازپیش‌تعریف‌شده را می‌سنجد و پس از آموزش هم ۲۱٫۸ درصد وظایف در هر دو نوبت شکست خوردند. همین مرز، پیام اصلی است: ترتیب دقیق فراخوانی ابزار و وضعیت نهایی حساب سیگنال قابل‌اعتمادتر می‌دهند، اما بخشی از ارزیابی رفتاری هنوز به یک داور زبانی تکیه دارد. پژوهش هم‌زمان دیگری ناپایداری جدی داورهای زبانی روی سرویس‌های مشترک را نشان می‌دهد. پیش‌نمایش HydraFusion گیت‌هاب و جذب سرمایه ۳۰۰ میلیون دلاری Gimlet نیز فشار اقتصادی مشابهی را از دو مسیر نشان می‌دهند: محاسبه را گزینشی مصرف کنید و کل گردش‌کار را بسنجید، اما ارزانی را با آمادگی تولید یکی نگیرید.


تحلیل ژرف

مقاله ۳ سپتامبر تیم هوش مصنوعی NPCI بحث «مدل کوچک یا بزرگ» را به آزمون گردش‌کار بانکی تبدیل می‌کند. FiMI Banking بر پایه یک مدل باز Gemma 4 با ۴٫۵ میلیارد پارامتر مؤثر ساخته شده و پنج حوزه را پوشش می‌دهد: حساب و احراز هویت مشتری، سپرده و اقساط وام، احراز شرایط طرح‌های دولتی، خسارت بیمه و مالیات کسرشده از سود سپرده. عامل با مشتری ساختگی، سند محصول نوشته‌شده در بانک، ابزار قابل‌فراخوانی و پایگاه داده مقداردهی‌شده کار می‌کند. هیچ پرونده یا گفت‌وگوی واقعی مشتری وارد آموزش نشده است. برای مدل درون‌بانکی و حتی کاملاً جدا، این طراحی افشای داده و هزینه اجرا را کاهش می‌دهد.

مسیر یادگیری تقویتی ۴۸٬۲۴۵ وظیفه در ۱۰۰ خانواده ساخت؛ ۱۰ هزار مورد را برای آموزش برداشت و هزار مورد را کنار گذاشت. هر وظیفه زنجیره درست فراخوانی ابزار را از قبل داشت. چهار معیار، گفت‌وگوی کامل را می‌سنجیدند: ترتیب ابزار، وضعیت نهایی پایگاه داده، رساندن اطلاعات لازم به مشتری و یک داوری درباره ادعای پاسخ. سه معیار اول دقیق و ماشینی‌اند و بیشتر وزن پاداش را می‌سازند. مقاله می‌گوید امتیازدهنده مستقل با ۹۷٫۲ درصد جرم پاداش پیاده‌سازی‌شده موافق بوده است. اصل ماجرا: استعلام موجودی پیش از برداشت با همان استعلام پس از برداشت یکسان نیست و پاسخ روان نمی‌تواند مانده حساب غلط را پنهان کند.

در همین آزمون محدود، امتیاز مدل از ۰٫۶۱۰ به ۰٫۶۹۷ رسید. مدل پایه ۱۲ میلیاردپارامتری ۰٫۶۹۰ گرفته بود؛ پس FiMI با ۲٫۷ برابر وزن فعال کمتر از هدف گذشت. امتیاز سخت‌گیرانه نسبت به ترتیب ابزار از ۰٫۵۹۰ به ۰٫۶۷۹ و سهم فراخوانی‌های مرتب از ۰٫۸۶۱ به ۰٫۹۱۹ رسید. خروجی خود مدل نیز با وجود افزایش متوسط فراخوانی ابزار از ۳٫۹ به ۴٫۳، از ۸۵۲ به ۶۰۲ توکن در هر گفت‌وگو کم شد؛ یعنی ۲۹ درصد کاهش. برآورد محاسباتی نویسندگان بدون استفاده از cache، برای FiMI رقم ۰٫۵۸ پتافلاپ در هر گفت‌وگو و برای مدل ۱۲ میلیاردی ۲٫۰۰ را نشان می‌دهد. این عدد برآورد یک آزمایشگاه است، نه صورتحساب واقعی بانک یا تضمین زمان پاسخ.

توزیع خطا اجازه جشن‌گرفتن نمی‌دهد. پس از آموزش، ۲۱٫۸ درصد وظایف کنارگذاشته‌شده در هر دو نوبت شکست خوردند، ۱۷٫۷ درصد فقط یک بار موفق شدند و ۶۰٫۵ درصد در هر دو بار گذشتند. امتیاز مسیر ساده نیز از ۰٫۸۲۱ به ۰٫۸۱۲ افت کرد. نتیجه معیارهای عمومی دوطرفه بود: MMLU-Pro و GPQA-Diamond بهتر شدند، اما IFEval، LiveCodeBench و BBEH اندکی پایین آمدند. امتیاز بیرون از آموزش در گام ۱۸۰ به اوج رسید و بعد، با وجود ادامه رشد امتیاز آموزش، عقب نشست؛ برای همین همان checkpoint زودتر انتخاب شد. نتیجه می‌گوید یک مدل فشرده را می‌توان درون توزیع وظایف خودش ارزان‌تر تخصصی کرد؛ نمی‌گوید همان مدل می‌تواند بدون حفاظ در بانک واقعی کار کند.

آزمایش ترجیحی مقاله مرز رفتار و توانایی را روشن‌تر می‌کند. در مجموعه جداگانه‌ای با حدود ۸۰۰ سناریو و سه تلاش برای هر مورد، امتناع از درخواست خارج از حوزه از ۵۲ به ۸۰ درصد رسید، رسیدگی درست به اطلاعات ورود ۱۰۰ درصد شد و پرسیدن جزئیات به‌جای حدس از ۳۸ به ۴۶ درصد بالا رفت. اما زنجیره چندابزاری تقریباً تکان نخورد: ۲۰ به ۲۱ درصد. نویسندگان می‌گویند جدول نهایی مشخص نمی‌کند checkpoint گزارش‌شده با پاسخ ترجیحی معلم ساخته شده یا بازنویسی خود مدل. کیفیت استدلال را نیز یک مدل زبانی، در یک نوبت آزمایش و بدون بازه اطمینان داوری کرده است. آموزش ترجیحی رفتاری را که مدل بلد بود منظم‌تر کرد؛ مهارت چندمرحله‌ای غایب را از هیچ نساخت.

یک مقاله دیگر که همان روز ثبت شد نشان می‌دهد این قید داوری کاملاً عملی است. پژوهشگران در دو مطالعه پیش‌ثبت‌شده با ۵۲٬۹۸۸ تلاش، همبستگی رتبه‌بندی تکراری در همان بازه را ۰٫۴۰۰ یافتند؛ درحالی‌که حد قبولی ۰٫۹۰ بود. اجرای دوباره ورودی کاملاً یکسان در روز بعد فقط ۰٫۷۸ توافق داشت، در برابر حد ۰٫۹۹. میانه توافق در چهار ارائه‌دهنده سرویس مشترک بین ۰٫۷۴ و ۰٫۸۸ بود و فراداده‌ای که سرویس‌ها برمی‌گرداندند، ناپایداری را توضیح نمی‌داد. دامنه ادعا محدود است: مقاله رتبه‌بندی ساختاریافته روی endpoint مشترک را آزموده، نه درون مدل یا هر نوع داوری را. پیام برای بانک روشن است: مانده حساب، مجوز و ترتیب عملیات را با کد بسنجید و پیش از سپردن مجوز انتشار به داور زبانی، خود داور را مثل ابزار اندازه‌گیری آزمایش کنید.

پیش‌نمایش HydraFusion گیت‌هاب همین اقتصاد را در حوزه‌ای دیگر نشان می‌دهد. مسیریاب Copilot CLI برای هر درخواست میان یک مدل، زنجیره تصاعدی یا نقد مدل از خانواده‌ای دیگر انتخاب می‌کند. در بهترین تنظیم آفلاین گیت‌هاب، کیفیت تأییدشده TerminalBench 2.1 نسبت به Claude Opus 5 حدود ۴٫۹ واحد درصد بالاتر و هزینه برآوردی ۶۷ درصد کمتر بود. در DeepSWE و معیار داخلی CheckpointBench، کیفیت به‌ترتیب ۱٫۵ و ۰٫۱ واحد پایین‌تر ماند و هزینه ۳۶ و ۶۵ درصد کم شد. ورودی و شرایط ثابت بود، اما اعداد حاصل معیارند، یکی از معیارها داخلی است و خود گیت‌هاب می‌گوید زمان پاسخ، پایداری، cache و ایمنی در کار واقعی هنوز باید سنجیده شوند. پیام مشترک پیروزی یک مسیریاب نیست؛ واحد اقتصادی از «یک بار فراخوانی مدل» به «گردش‌کار سنجیده‌شده» تغییر کرده است.

سرمایه نیز دنبال همین امکان می‌رود. Gimlet Labs دور B به ارزش ۳۰۰ میلیون دلار با رهبری Andreessen Horowitz اعلام کرد تا ابر استنتاجی بسازد که بار را میان GPU، CPU، محاسبه نزدیک حافظه و شتاب‌دهنده‌های dataflow تقسیم می‌کند. شرکت از سرعت ۵ تا ۱۰ برابر با توان مصرفی یکسان، چند میلیارد دلار درآمد قراردادی تازه از ماه مارس، صف چند گیگاواتی مرکز داده و حرکت به‌سوی صدها مگاوات ظرفیت مدیریت‌شده حرف می‌زند. هیچ‌کدام از این ادعاهای عملیاتی در این گزارش حسابرسی مستقل نشده‌اند؛ درآمد قراردادی با درآمد شناسایی‌شده فرق دارد، صف پروژه ظرفیت تحویل‌شده نیست و ارزش‌گذاری و نام مشتری نیز اعلام نشده است. با این قیدها، معامله شرط مالی را روشن می‌کند: بازار برای زمان‌بندی بهتر، تخصص و بهره‌وری برق هم ارزش قائل شده، نه فقط برای شتاب‌دهنده بزرگ‌تر.

پس‌زمینه اقتصاد کلان، حد قبولی این شرط را بالا می‌برد. اداره آمار کار آمریکا از افزایش ۱۶۲ هزار شغل غیرکشاورزی در اوت خبر داد؛ بسیار بیشتر از متوسط ۳۱ هزار شغل در ۱۲ ماه قبل. نرخ بیکاری ۴٫۱ درصد ثابت ماند و دستمزد ساعتی نسبت به سال قبل ۳٫۱ درصد رشد کرد. در همان گزارش، اشتغال بخش اطلاعات ۲۳ هزار نفر کم شد که ۸ هزار نفر آن به زیرگروه زیرساخت محاسبات، پردازش داده و میزبانی وب مربوط بود. این داده‌ها اولیه و قابل‌بازبینی‌اند و هیچ چیز در گزارش ثابت نمی‌کند هوش مصنوعی علت کاهش شغل بوده است. کریستوفر والر، عضو هیئت‌مدیره فدرال رزرو، جداگانه برنامه مراکز داده و AI را محرک سرمایه‌گذاری سریع دانست، اما گفت این بخش سرمایه‌بر است و تورم داغ اوت می‌تواند افزایش نرخ بهره در نشست ۱۵ و ۱۶ سپتامبر را توجیه کند. این نظر مشروط یک سیاست‌گذار است، نه تصمیم کمیته بازار باز.

برای بانک یا فین‌تک تحت نظارت، ترتیب اجرا اکنون روشن‌تر است. با چند عمل شروع کنید که پاسخ درستشان را بتوان با قاعده مجوز، ترتیب مجاز ابزار و وضعیت نهایی دفترکل نوشت. سناریوهای بازپخش‌پذیر را با هویت ساختگی و نسخه مشخص مقررات محصول بسازید. ارزیاب را بیرون از اختیار عامل نگه دارید، شکست در تلاش‌های تکراری را کنار میانگین امتیاز منتشر کنید و هزینه بازخوانی prompt، فراخوانی ابزار، تأخیر و رسیدگی به استثنا را یکجا بسنجید. تا وقتی علت دسته شکست پایدار روشن نشده، تأیید انسان باید پیش از عمل تغییردهنده حساب بماند. مدل حاکمیتی یا درون‌سازمانی می‌تواند افشای داده را کم کند، اما کنترل دسترسی، ثبت حسابرسی، به‌روزرسانی مدل و بازگشت از تراکنش غلط را خودکار حل نمی‌کند.

شاهد بعدی باید سخت‌تر از میانگین معیار باشد. NPCI باید فایل یا دسترسی کافی برای بازتولید مستقل بدهد، checkpoint ترجیحی را مشخص کند، از چند داور یا سنجش توافق انسانی استفاده کند و تغییر مقررات و زنجیره طولانی‌تر را بیازماید. HydraFusion باید توزیع واقعی تأخیر، retry و هزینه پرداخت‌شده را منتشر کند. Gimlet باید ظرفیت تحویل‌شده و بهره‌وری تأییدشده مشتری نشان دهد. داده تورم آمریکا و نشست ۱۵ و ۱۶ سپتامبر نیز هزینه کوتاه‌مدت سرمایه این پروژه‌ها را تعیین می‌کنند. نتیجه دفاع‌پذیر امروز دقیق است: FiMI Banking نشان می‌دهد طراحی گردش‌کار قابل‌راستی‌آزمایی می‌تواند مدل کوچک را با محاسبه کمتر از یک پایه بزرگ‌تر جلو بیندازد. سهم ۲۱٫۸ درصدی شکست پایدار یادآوری می‌کند محصول واقعی همان لایه راستی‌آزمایی است، نه امتیاز تیترساز.


منابع و اسناد

  1. 01FiMI Banking: A Sovereign Model for Indian Retail BankingNPCI AI Research Team / arXiv · ۱۲ شهریور ۱۴۰۵
  2. 02Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared EndpointsUniversity of Sheffield and Ranplan Wireless / arXiv · ۱۲ شهریور ۱۴۰۵
  3. 03Project HydraFusion: Frontier Quality via Multi-Model OrchestrationGitHub · ۱۳ شهریور ۱۴۰۵
  4. 04Announcing Gimlet Labs' Series BGimlet Labs · ۱۳ شهریور ۱۴۰۵
  5. 05The Employment Situation — August 2026U.S. Bureau of Labor Statistics · ۱۳ شهریور ۱۴۰۵
  6. 06The Economic Outlook and Some Comments on My Policy CommunicationBoard of Governors of the Federal Reserve System · ۱۲ شهریور ۱۴۰۵

برچسب‌ها

FiMI بانکیان‌پی‌سی‌آیعامل بانکیپاداش قابل‌راستی‌آزماییمدل زبانی کوچکاقتصاد استنتاجارزیابی هوش مصنوعیسیاست پولی

اخبار مرتبط

هوش مصنوعی یاد می‌گیرد کِی پردازش کند؛ درآمد در بالادست جمع می‌شود
۳۰ مرداد ۱۴۰۵منبع: Google DeepMind

هوش مصنوعی یاد می‌گیرد کِی پردازش کند؛ درآمد در بالادست جمع می‌شود

دو پیش‌چاپ ۲۰ اوت، بهره‌وری AI را به مسئله تخصیص تبدیل می‌کنند: یکی می‌پرسد آیا پیش از مسیریابی یک پرسش، خرید برآورد دقیق‌تر و پرهزینه‌تر از ارزش مدل می‌ارزد؛ دیگری مدلی ۱٫۵ میلیاردپارامتری را برای انتخاب بودجه استدلال آموزش می‌دهد و روی MATH500 با افت محدود دقت، ۴۱ درصد توکن پاسخ کمتر گزارش می‌کند. داده تازه خدمات آمریکا تصویر مالی مشابهی دارد: درآمد اسمی و تعدیل‌نشده نسبت به سال قبل در پردازش و میزبانی داده ۲۰٫۶ درصد و در نشر نرم‌افزار ۱۵٫۷ درصد بالا رفت، اما در طراحی سیستم‌های رایانه‌ای فقط ۲٫۸ درصد رشد کرد. سود خالص قابل انتساب نیم‌سال JCET نیز با رشد ۵ درصدی درآمد، ۷۹٫۴ درصد افزایش یافت و درآمد الکترونیک محاسباتی ۴۰٫۴ درصد رشد کرد. شواهد از تمرکز ارزش در تصمیم‌گیری درباره محل مصرف پردازش و تأمین زیرساخت آن خبر می‌دهد، اما اشتغال جوانان و CPI ژاپن هنوز اجازه نمی‌دهند این روند را بهره‌وری فراگیر بنامیم.

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد
۲۹ شهریور ۱۴۰۵منبع: ggml-org

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد

توسعه‌دهندگان لاما سی‌پلاس‌پلاس در ۱۹ سپتامبر مجموعه‌ای از تغییرات اجرای مدل روی پردازنده‌های گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارش‌شده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغام‌های مشخص است، نه سریع‌تر شدن همه مدل‌ها یا اثبات کاهش هزینه. اصلاح جداگانه‌ای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یک‌ساله مصرف‌کنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایت‌های ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
۲۸ شهریور ۱۴۰۵منبع: Accenture

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد

اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دست‌کم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایه‌گذاری کنند. این برنامه، هزینه انجام‌شده یا تضمین ایمنی نیست. هم‌زمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا می‌شود. تحلیل ژرف توضیح می‌دهد چرا دسترسی ارزیاب، اختیار تصمیم‌گیری و شواهد اقدام اصلاحی را باید جدا سنجید.

تحلیل مستقل ژرف بر پایه منابع اصلی تدوین شده است؛ برای بررسی جزئیات و زمینه کامل به پیوندهای بالا مراجعه کنید.

می‌خواهید هوش مصنوعی را در کسب‌وکار خود پیاده‌سازی کنید؟

با تیم ما تماس بگیرید و درباره راهکارهای هوش مصنوعی صحبت کنید.

تماس با ما