Naive-N0.5-Flash؛ مدل باز ۳۰۹ میلیاردی با کانتکست یک میلیونی
NaiveAI مدل Naive-N0.5-Flash را با مجوز MIT منتشر کرد: ترکیب خبرگان ۳۰۹ میلیاردی برای کدنویسی، با کانتکست یک میلیون توکنی و بدون لایه توجه کامل.

فهرست مطالب
استارتاپ NaiveAI روز ۲۷ سپتامبر ۲۰۲۶ (۵ مهر ۱۴۰۵) مدل Naive-N0.5-Flash را با وزنهای باز و مجوز MIT روی Hugging Face منتشر کرد. این مدل ترکیب خبرگان (Mixture-of-Experts یا MoE) با ۳۰۹ میلیارد پارامتر است که در هر توکن ۱۵٫۵ میلیارد پارامتر آن فعال میشود. مدل بدون حتی یک لایه توجه کامل (Full Attention)، کانتکست (Context) یک میلیون توکنی را بهصورت بومی پشتیبانی میکند. به گفته شرکت، کاربرد اصلی آن کدنویسی و پژوهش و توسعه در حوزه هوش مصنوعی است.
Naive-N0.5-Flash چه مشخصاتی دارد؟
خلاصه مشخصات طبق کارت مدل (Model Card) و صفحه پژوهشی NaiveAI:
| ویژگی | مقدار |
|---|---|
| کل پارامترها / پارامترهای فعال | ۳۰۹ میلیارد / ۱۵٫۵ میلیارد |
| تعداد لایهها | ۴۸ (۳۹ لایه SWA و ۹ لایه DSA) |
| کانتکست | یک میلیون توکن، بومی |
| داده آموزش | ۳٫۲۵ تریلیون توکن در سه مرحله |
| مدل پایه | MiMo-V2.5 شیائومی |
| مجوز | MIT |
| حجم وزنها | حدود ۳۱۵ گیگابایت |
اگر با مفهوم پارامتر و معماری ترنسفورمر آشنا نیستید، پیش از ادامه توضیح ساده مدل زبانی بزرگ را بخوانید.
معماری: توجه پنجرهای بهجای توجه کامل
مهمترین نکته فنی این مدل این است که هیچ لایه توجه کاملی ندارد. در توجه کامل هر توکن به همه توکنهای قبلی نگاه میکند و هزینه آن با بلندتر شدن متن بهسرعت بالا میرود. Naive-N0.5-Flash بهجای آن، عمدتاً با نسبت ۵ به ۱، دو نوع لایه را ترکیب کرده است:
- توجه پنجره لغزان (Sliding-Window Attention): هر توکن فقط ۱۲۸ توکن نزدیک خود را میبیند.
- توجه تُنُک DeepSeek (DeepSeek Sparse Attention): از کل متن، ۲۰۴۸ توکن برتر را برای توجه انتخاب میکند.
مدل در سه مرحله آموزش دیده است: ۵۰ میلیارد توکن برای گرم کردن بخش انتخابگر (Indexer)، ۳ تریلیون توکن آموزش توجه تُنُک و ۲۰۰ میلیارد توکن برای کاهش نرخ یادگیری. NaiveAI در صفحه پژوهشی خود از تیم MiMo شیائومی برای انتشار عمومی مدل پایه تشکر کرده است.
ادعای «ساختن هوش مصنوعی با هوش مصنوعی»
عنوان گزارش NaiveAI «ساختن هوش مصنوعی پیشرو با هوش مصنوعی» است. به گفته شرکت، مدلهای هوش مصنوعی معماری توجه ترکیبی را کاوش و طراحی کردهاند و سیستمهای آموزش، استنتاج و استقرار را هم بهینه کردهاند. نمونه مشخص، موتور استنتاج NaiveRT است که به گفته شرکت «در شش روز توسط پژوهشگران انسانی همراه با مدلهای هوش مصنوعی و در ۱۵۱ آزمایش بهینهسازی مستند» ساخته شده است.
خود NaiveAI میگوید پژوهشگران انسانی جهت کار، محدودیتها و معیارها را تعیین کرده و تصمیمهای کلیدی را گرفتهاند. RuntimeWire در گزارش خود یادآوری میکند که شرکت روشن نکرده دقیقاً چه سهمی از کار را هوش مصنوعی انجام داده و این سهم را چطور سنجیده است.
بنچمارکها و سرعت: ادعاهای خود شرکت
NaiveAI این نمرهها را برای کدنویسی گزارش کرده است: ۶۷٫۸ در DeepSWE v1.1، ۸۶٫۷ در Terminal-Bench 2.1 و ۷۳٫۶ در SWE-bench Pro. طبق صفحه پژوهشی، ارزیابیها با Claude Code 2.1.207، کانتکست یک میلیون توکنی، دمای ۱٫۰ و top-p برابر ۰٫۹۵ انجام شدهاند. این نمرهها هنوز بهطور مستقل تأیید نشدهاند.
درباره سرعت، شرکت از ۵۰ توکن در ثانیه برای هر کاربر در حالت Standard و تا ۲۰۰۰ توکن در ثانیه در حالت Ultrafast خبر میدهد. طبق صفحه پژوهشی، موتور NaiveRT در آزمون تکجریانی روی هشت GPU به اوج ۲۱۲۲ توکن در ثانیه رسیده است؛ این عدد فقط مرحله تولید (Decode) را بدون پردازش پرامپت میسنجد. API رسمی مدل هم با قیمت ۰٫۱۰ دلار برای هر میلیون توکن ورودی، ۰٫۴۰ دلار برای خروجی و ۰٫۰۱ دلار برای خواندن از کش عرضه شده است.
اجرای Naive-N0.5-Flash به چه سختافزاری نیاز دارد؟
طبق کارت مدل، اجرای Naive-N0.5-Flash به GPUهای NVIDIA با پشتیبانی FP8 نیاز دارد. وزنها بهتنهایی حدود ۳۱۵ گیگابایت فضا میگیرند و استنتاج هم حافظه اضافی میخواهد. پس این مدلی نیست که مثل مدلهای کوچکتر با Ollama روی کامپیوتر شخصی اجرا شود. نمونه بارگذاری با کتابخانه Transformers طبق کارت مدل:
pip install "transformers[torch,kernels]>=5.17.0"
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "NaiveAI/Naive-N0.5-Flash-FP8"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
trust_remote_code=True,
dtype="auto",
device_map="auto",
)
توجه کنید که trust_remote_code=True کد پایتون مخزن مدل را روی سیستم شما اجرا میکند؛ پیش از اجرا آن را بررسی کنید. به گفته NaiveAI، کد منبع NaiveRT، محیط Docker Compose و اسکریپتهای بنچمارک قرار است تا ۱۲ اکتبر (۲۰ مهر) منتشر شوند.
چرا این خبر برای توسعهدهندگان مهم است؟
مجوز MIT یعنی میتوانید مدل را تغییر دهید، روی زیرساخت خودتان میزبانی کنید و در محصول تجاری به کار ببرید. برای تیمهایی که نمیخواهند کد و دادهشان از سرور خودشان خارج شود، یا به دلیل محدودیت پرداخت و دسترسی نمیتوانند روی API سرویسهای خارجی حساب کنند، یک مدل باز کدنویسی با کانتکست یک میلیونی گزینهای است که ارزش بررسی دارد.
در مقابل، هزینه سختافزار بالاست و نمرههای اعلامشده فعلاً ادعای خود سازندهاند. پیشنهاد ما این است که پیش از هر تصمیمی، مدل را روی کارهای واقعی تیم خودتان بسنجید و منتظر ارزیابیهای مستقل بمانید.




دیدگاهها
دیدگاهها پس از بررسی تحریریه منتشر میشوند. توهین، تبلیغ و لینکهای بیربط حذف میشوند؛ نقد فنی و مستند همیشه خوشآمد است.
هنوز کسی چیزی ننوشته. اولین دیدگاه را شما ثبت کنید.