FiMI بانکی با پاداش قابلراستیآزمایی، در وظایف خودش از مدل ۱۲ میلیاردی جلو میزند

پژوهش تازه FiMI Banking از تیم هوش مصنوعی NPCI یک ادعای عملی برای هوش مصنوعی مالی دارد: مدل ۴٫۵ میلیاردپارامتری در محیط بانکی بازپخشپذیر آموزش دید و امتیاز آزمون نگهداشتهشده را از ۰٫۶۱۰ به ۰٫۶۹۷ رساند؛ کمی بالاتر از ۰٫۶۹۰ مدل پایه ۱۲ میلیاردپارامتری، آن هم با ۲۹ درصد توکن خروجی کمتر در هر گفتوگو. این نتیجه برتری عمومی مدل کوچک را ثابت نمیکند. آزمون فقط هزار وظیفه مصنوعی بانکداری خرد هند با ابزار، وضعیت حساب و پاداش ازپیشتعریفشده را میسنجد و پس از آموزش هم ۲۱٫۸ درصد وظایف در هر دو نوبت شکست خوردند. همین مرز، پیام اصلی است: ترتیب دقیق فراخوانی ابزار و وضعیت نهایی حساب سیگنال قابلاعتمادتر میدهند، اما بخشی از ارزیابی رفتاری هنوز به یک داور زبانی تکیه دارد. پژوهش همزمان دیگری ناپایداری جدی داورهای زبانی روی سرویسهای مشترک را نشان میدهد. پیشنمایش HydraFusion گیتهاب و جذب سرمایه ۳۰۰ میلیون دلاری Gimlet نیز فشار اقتصادی مشابهی را از دو مسیر نشان میدهند: محاسبه را گزینشی مصرف کنید و کل گردشکار را بسنجید، اما ارزانی را با آمادگی تولید یکی نگیرید.
تحلیل ژرف
مقاله ۳ سپتامبر تیم هوش مصنوعی NPCI بحث «مدل کوچک یا بزرگ» را به آزمون گردشکار بانکی تبدیل میکند. FiMI Banking بر پایه یک مدل باز Gemma 4 با ۴٫۵ میلیارد پارامتر مؤثر ساخته شده و پنج حوزه را پوشش میدهد: حساب و احراز هویت مشتری، سپرده و اقساط وام، احراز شرایط طرحهای دولتی، خسارت بیمه و مالیات کسرشده از سود سپرده. عامل با مشتری ساختگی، سند محصول نوشتهشده در بانک، ابزار قابلفراخوانی و پایگاه داده مقداردهیشده کار میکند. هیچ پرونده یا گفتوگوی واقعی مشتری وارد آموزش نشده است. برای مدل درونبانکی و حتی کاملاً جدا، این طراحی افشای داده و هزینه اجرا را کاهش میدهد.
مسیر یادگیری تقویتی ۴۸٬۲۴۵ وظیفه در ۱۰۰ خانواده ساخت؛ ۱۰ هزار مورد را برای آموزش برداشت و هزار مورد را کنار گذاشت. هر وظیفه زنجیره درست فراخوانی ابزار را از قبل داشت. چهار معیار، گفتوگوی کامل را میسنجیدند: ترتیب ابزار، وضعیت نهایی پایگاه داده، رساندن اطلاعات لازم به مشتری و یک داوری درباره ادعای پاسخ. سه معیار اول دقیق و ماشینیاند و بیشتر وزن پاداش را میسازند. مقاله میگوید امتیازدهنده مستقل با ۹۷٫۲ درصد جرم پاداش پیادهسازیشده موافق بوده است. اصل ماجرا: استعلام موجودی پیش از برداشت با همان استعلام پس از برداشت یکسان نیست و پاسخ روان نمیتواند مانده حساب غلط را پنهان کند.
در همین آزمون محدود، امتیاز مدل از ۰٫۶۱۰ به ۰٫۶۹۷ رسید. مدل پایه ۱۲ میلیاردپارامتری ۰٫۶۹۰ گرفته بود؛ پس FiMI با ۲٫۷ برابر وزن فعال کمتر از هدف گذشت. امتیاز سختگیرانه نسبت به ترتیب ابزار از ۰٫۵۹۰ به ۰٫۶۷۹ و سهم فراخوانیهای مرتب از ۰٫۸۶۱ به ۰٫۹۱۹ رسید. خروجی خود مدل نیز با وجود افزایش متوسط فراخوانی ابزار از ۳٫۹ به ۴٫۳، از ۸۵۲ به ۶۰۲ توکن در هر گفتوگو کم شد؛ یعنی ۲۹ درصد کاهش. برآورد محاسباتی نویسندگان بدون استفاده از cache، برای FiMI رقم ۰٫۵۸ پتافلاپ در هر گفتوگو و برای مدل ۱۲ میلیاردی ۲٫۰۰ را نشان میدهد. این عدد برآورد یک آزمایشگاه است، نه صورتحساب واقعی بانک یا تضمین زمان پاسخ.
توزیع خطا اجازه جشنگرفتن نمیدهد. پس از آموزش، ۲۱٫۸ درصد وظایف کنارگذاشتهشده در هر دو نوبت شکست خوردند، ۱۷٫۷ درصد فقط یک بار موفق شدند و ۶۰٫۵ درصد در هر دو بار گذشتند. امتیاز مسیر ساده نیز از ۰٫۸۲۱ به ۰٫۸۱۲ افت کرد. نتیجه معیارهای عمومی دوطرفه بود: MMLU-Pro و GPQA-Diamond بهتر شدند، اما IFEval، LiveCodeBench و BBEH اندکی پایین آمدند. امتیاز بیرون از آموزش در گام ۱۸۰ به اوج رسید و بعد، با وجود ادامه رشد امتیاز آموزش، عقب نشست؛ برای همین همان checkpoint زودتر انتخاب شد. نتیجه میگوید یک مدل فشرده را میتوان درون توزیع وظایف خودش ارزانتر تخصصی کرد؛ نمیگوید همان مدل میتواند بدون حفاظ در بانک واقعی کار کند.
آزمایش ترجیحی مقاله مرز رفتار و توانایی را روشنتر میکند. در مجموعه جداگانهای با حدود ۸۰۰ سناریو و سه تلاش برای هر مورد، امتناع از درخواست خارج از حوزه از ۵۲ به ۸۰ درصد رسید، رسیدگی درست به اطلاعات ورود ۱۰۰ درصد شد و پرسیدن جزئیات بهجای حدس از ۳۸ به ۴۶ درصد بالا رفت. اما زنجیره چندابزاری تقریباً تکان نخورد: ۲۰ به ۲۱ درصد. نویسندگان میگویند جدول نهایی مشخص نمیکند checkpoint گزارششده با پاسخ ترجیحی معلم ساخته شده یا بازنویسی خود مدل. کیفیت استدلال را نیز یک مدل زبانی، در یک نوبت آزمایش و بدون بازه اطمینان داوری کرده است. آموزش ترجیحی رفتاری را که مدل بلد بود منظمتر کرد؛ مهارت چندمرحلهای غایب را از هیچ نساخت.
یک مقاله دیگر که همان روز ثبت شد نشان میدهد این قید داوری کاملاً عملی است. پژوهشگران در دو مطالعه پیشثبتشده با ۵۲٬۹۸۸ تلاش، همبستگی رتبهبندی تکراری در همان بازه را ۰٫۴۰۰ یافتند؛ درحالیکه حد قبولی ۰٫۹۰ بود. اجرای دوباره ورودی کاملاً یکسان در روز بعد فقط ۰٫۷۸ توافق داشت، در برابر حد ۰٫۹۹. میانه توافق در چهار ارائهدهنده سرویس مشترک بین ۰٫۷۴ و ۰٫۸۸ بود و فرادادهای که سرویسها برمیگرداندند، ناپایداری را توضیح نمیداد. دامنه ادعا محدود است: مقاله رتبهبندی ساختاریافته روی endpoint مشترک را آزموده، نه درون مدل یا هر نوع داوری را. پیام برای بانک روشن است: مانده حساب، مجوز و ترتیب عملیات را با کد بسنجید و پیش از سپردن مجوز انتشار به داور زبانی، خود داور را مثل ابزار اندازهگیری آزمایش کنید.
پیشنمایش HydraFusion گیتهاب همین اقتصاد را در حوزهای دیگر نشان میدهد. مسیریاب Copilot CLI برای هر درخواست میان یک مدل، زنجیره تصاعدی یا نقد مدل از خانوادهای دیگر انتخاب میکند. در بهترین تنظیم آفلاین گیتهاب، کیفیت تأییدشده TerminalBench 2.1 نسبت به Claude Opus 5 حدود ۴٫۹ واحد درصد بالاتر و هزینه برآوردی ۶۷ درصد کمتر بود. در DeepSWE و معیار داخلی CheckpointBench، کیفیت بهترتیب ۱٫۵ و ۰٫۱ واحد پایینتر ماند و هزینه ۳۶ و ۶۵ درصد کم شد. ورودی و شرایط ثابت بود، اما اعداد حاصل معیارند، یکی از معیارها داخلی است و خود گیتهاب میگوید زمان پاسخ، پایداری، cache و ایمنی در کار واقعی هنوز باید سنجیده شوند. پیام مشترک پیروزی یک مسیریاب نیست؛ واحد اقتصادی از «یک بار فراخوانی مدل» به «گردشکار سنجیدهشده» تغییر کرده است.
سرمایه نیز دنبال همین امکان میرود. Gimlet Labs دور B به ارزش ۳۰۰ میلیون دلار با رهبری Andreessen Horowitz اعلام کرد تا ابر استنتاجی بسازد که بار را میان GPU، CPU، محاسبه نزدیک حافظه و شتابدهندههای dataflow تقسیم میکند. شرکت از سرعت ۵ تا ۱۰ برابر با توان مصرفی یکسان، چند میلیارد دلار درآمد قراردادی تازه از ماه مارس، صف چند گیگاواتی مرکز داده و حرکت بهسوی صدها مگاوات ظرفیت مدیریتشده حرف میزند. هیچکدام از این ادعاهای عملیاتی در این گزارش حسابرسی مستقل نشدهاند؛ درآمد قراردادی با درآمد شناساییشده فرق دارد، صف پروژه ظرفیت تحویلشده نیست و ارزشگذاری و نام مشتری نیز اعلام نشده است. با این قیدها، معامله شرط مالی را روشن میکند: بازار برای زمانبندی بهتر، تخصص و بهرهوری برق هم ارزش قائل شده، نه فقط برای شتابدهنده بزرگتر.
پسزمینه اقتصاد کلان، حد قبولی این شرط را بالا میبرد. اداره آمار کار آمریکا از افزایش ۱۶۲ هزار شغل غیرکشاورزی در اوت خبر داد؛ بسیار بیشتر از متوسط ۳۱ هزار شغل در ۱۲ ماه قبل. نرخ بیکاری ۴٫۱ درصد ثابت ماند و دستمزد ساعتی نسبت به سال قبل ۳٫۱ درصد رشد کرد. در همان گزارش، اشتغال بخش اطلاعات ۲۳ هزار نفر کم شد که ۸ هزار نفر آن به زیرگروه زیرساخت محاسبات، پردازش داده و میزبانی وب مربوط بود. این دادهها اولیه و قابلبازبینیاند و هیچ چیز در گزارش ثابت نمیکند هوش مصنوعی علت کاهش شغل بوده است. کریستوفر والر، عضو هیئتمدیره فدرال رزرو، جداگانه برنامه مراکز داده و AI را محرک سرمایهگذاری سریع دانست، اما گفت این بخش سرمایهبر است و تورم داغ اوت میتواند افزایش نرخ بهره در نشست ۱۵ و ۱۶ سپتامبر را توجیه کند. این نظر مشروط یک سیاستگذار است، نه تصمیم کمیته بازار باز.
برای بانک یا فینتک تحت نظارت، ترتیب اجرا اکنون روشنتر است. با چند عمل شروع کنید که پاسخ درستشان را بتوان با قاعده مجوز، ترتیب مجاز ابزار و وضعیت نهایی دفترکل نوشت. سناریوهای بازپخشپذیر را با هویت ساختگی و نسخه مشخص مقررات محصول بسازید. ارزیاب را بیرون از اختیار عامل نگه دارید، شکست در تلاشهای تکراری را کنار میانگین امتیاز منتشر کنید و هزینه بازخوانی prompt، فراخوانی ابزار، تأخیر و رسیدگی به استثنا را یکجا بسنجید. تا وقتی علت دسته شکست پایدار روشن نشده، تأیید انسان باید پیش از عمل تغییردهنده حساب بماند. مدل حاکمیتی یا درونسازمانی میتواند افشای داده را کم کند، اما کنترل دسترسی، ثبت حسابرسی، بهروزرسانی مدل و بازگشت از تراکنش غلط را خودکار حل نمیکند.
شاهد بعدی باید سختتر از میانگین معیار باشد. NPCI باید فایل یا دسترسی کافی برای بازتولید مستقل بدهد، checkpoint ترجیحی را مشخص کند، از چند داور یا سنجش توافق انسانی استفاده کند و تغییر مقررات و زنجیره طولانیتر را بیازماید. HydraFusion باید توزیع واقعی تأخیر، retry و هزینه پرداختشده را منتشر کند. Gimlet باید ظرفیت تحویلشده و بهرهوری تأییدشده مشتری نشان دهد. داده تورم آمریکا و نشست ۱۵ و ۱۶ سپتامبر نیز هزینه کوتاهمدت سرمایه این پروژهها را تعیین میکنند. نتیجه دفاعپذیر امروز دقیق است: FiMI Banking نشان میدهد طراحی گردشکار قابلراستیآزمایی میتواند مدل کوچک را با محاسبه کمتر از یک پایه بزرگتر جلو بیندازد. سهم ۲۱٫۸ درصدی شکست پایدار یادآوری میکند محصول واقعی همان لایه راستیآزمایی است، نه امتیاز تیترساز.
منابع و اسناد
- 01FiMI Banking: A Sovereign Model for Indian Retail BankingNPCI AI Research Team / arXiv · ۱۲ شهریور ۱۴۰۵
- 02Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared EndpointsUniversity of Sheffield and Ranplan Wireless / arXiv · ۱۲ شهریور ۱۴۰۵
- 03Project HydraFusion: Frontier Quality via Multi-Model OrchestrationGitHub · ۱۳ شهریور ۱۴۰۵
- 04Announcing Gimlet Labs' Series BGimlet Labs · ۱۳ شهریور ۱۴۰۵
- 05The Employment Situation — August 2026U.S. Bureau of Labor Statistics · ۱۳ شهریور ۱۴۰۵
- 06The Economic Outlook and Some Comments on My Policy CommunicationBoard of Governors of the Federal Reserve System · ۱۲ شهریور ۱۴۰۵
برچسبها
اخبار مرتبط

هوش مصنوعی یاد میگیرد کِی پردازش کند؛ درآمد در بالادست جمع میشود
دو پیشچاپ ۲۰ اوت، بهرهوری AI را به مسئله تخصیص تبدیل میکنند: یکی میپرسد آیا پیش از مسیریابی یک پرسش، خرید برآورد دقیقتر و پرهزینهتر از ارزش مدل میارزد؛ دیگری مدلی ۱٫۵ میلیاردپارامتری را برای انتخاب بودجه استدلال آموزش میدهد و روی MATH500 با افت محدود دقت، ۴۱ درصد توکن پاسخ کمتر گزارش میکند. داده تازه خدمات آمریکا تصویر مالی مشابهی دارد: درآمد اسمی و تعدیلنشده نسبت به سال قبل در پردازش و میزبانی داده ۲۰٫۶ درصد و در نشر نرمافزار ۱۵٫۷ درصد بالا رفت، اما در طراحی سیستمهای رایانهای فقط ۲٫۸ درصد رشد کرد. سود خالص قابل انتساب نیمسال JCET نیز با رشد ۵ درصدی درآمد، ۷۹٫۴ درصد افزایش یافت و درآمد الکترونیک محاسباتی ۴۰٫۴ درصد رشد کرد. شواهد از تمرکز ارزش در تصمیمگیری درباره محل مصرف پردازش و تأمین زیرساخت آن خبر میدهد، اما اشتغال جوانان و CPI ژاپن هنوز اجازه نمیدهند این روند را بهرهوری فراگیر بنامیم.

لاما سیپلاسپلاس با ادغام محاسبات، بعضی آزمونهای مک را سریعتر کرد
توسعهدهندگان لاما سیپلاسپلاس در ۱۹ سپتامبر مجموعهای از تغییرات اجرای مدل روی پردازندههای گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارششده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغامهای مشخص است، نه سریعتر شدن همه مدلها یا اثبات کاهش هزینه. اصلاح جداگانهای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یکساله مصرفکنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایتهای ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دستکم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایهگذاری کنند. این برنامه، هزینه انجامشده یا تضمین ایمنی نیست. همزمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا میشود. تحلیل ژرف توضیح میدهد چرا دسترسی ارزیاب، اختیار تصمیمگیری و شواهد اقدام اصلاحی را باید جدا سنجید.