۱۴۰۵ مهر ۱۵, چهارشنبه
دلار آمریکا۲۶۳٬۴۱۰▼ ۲٫۰۵٪یورو۲۹۵٬۹۹۰▼ ۲٫۴۴٪درهم امارات۷۲٬۱۰۳▼ ۱٫۸۳٪سکه امامی۲۶۷٬۶۸۵٬۰۰۰▼ ۱٫۵۸٪طلای ۱۸ عیار (گرم)۲۶٬۲۷۴٬۵۰۰▼ ۱٫۷۷٪انس طلا۴٬۱۲۰ $▼ ۱٫۰۴٪تتر۲۶۳٬۷۸۹▼ ۱٫۹۷٪بیت‌کوین۸۳٬۸۱۴ $▼ ۲٫۱۷٪اتریوم۲٬۵۸۱ $▼ ۴٫۳۷٪سولانا۱۱۷٫۶۷ $▼ ۲٫۹۱٪اپل۳۳۳٫۶۳ $▲ ۰٫۲۲٪انویدیا۲۳۹٫۲۴ $▲ ۰٫۱۴٪مایکروسافت۵۲۹٫۳۰ $▲ ۰٫۷۸٪آلفابت (گوگل)۳۴۷٫۶۸ $▲ ۰٫۳۵٪تسلا۳۸۰٫۶۸ $▲ ۰٫۵۲٪شاخص نزدک۲۷٬۶۰۰ $▲ ۰٫۴۵٪
نرخ ارز

Naive-N0.5-Flash؛ مدل باز ۳۰۹ میلیاردی با کانتکست یک میلیونی

NaiveAI مدل Naive-N0.5-Flash را با مجوز MIT منتشر کرد: ترکیب خبرگان ۳۰۹ میلیاردی برای کدنویسی، با کانتکست یک میلیون توکنی و بدون لایه توجه کامل.

کاور گرافیکی DevNA با عنوان «Naive-N0.5-Flash»: مدل باز ۳۰۹ میلیاردی با کانتکست یک میلیونی
کاور گرافیکی DevNA با عنوان «Naive-N0.5-Flash»: مدل باز ۳۰۹ میلیاردی با کانتکست یک میلیونی
فهرست مطالب
  1. Naive-N0.5-Flash چه مشخصاتی دارد؟
  2. معماری: توجه پنجره‌ای به‌جای توجه کامل
  3. ادعای «ساختن هوش مصنوعی با هوش مصنوعی»
  4. بنچمارک‌ها و سرعت: ادعاهای خود شرکت
  5. اجرای Naive-N0.5-Flash به چه سخت‌افزاری نیاز دارد؟
  6. چرا این خبر برای توسعه‌دهندگان مهم است؟

استارتاپ NaiveAI روز ۲۷ سپتامبر ۲۰۲۶ (۵ مهر ۱۴۰۵) مدل Naive-N0.5-Flash را با وزن‌های باز و مجوز MIT روی Hugging Face منتشر کرد. این مدل ترکیب خبرگان (Mixture-of-Experts یا MoE) با ۳۰۹ میلیارد پارامتر است که در هر توکن ۱۵٫۵ میلیارد پارامتر آن فعال می‌شود. مدل بدون حتی یک لایه توجه کامل (Full Attention)، کانتکست (Context) یک میلیون توکنی را به‌صورت بومی پشتیبانی می‌کند. به گفته شرکت، کاربرد اصلی آن کدنویسی و پژوهش و توسعه در حوزه هوش مصنوعی است.

Naive-N0.5-Flash چه مشخصاتی دارد؟

خلاصه مشخصات طبق کارت مدل (Model Card) و صفحه پژوهشی NaiveAI:

ویژگی مقدار
کل پارامترها / پارامترهای فعال ۳۰۹ میلیارد / ۱۵٫۵ میلیارد
تعداد لایه‌ها ۴۸ (۳۹ لایه SWA و ۹ لایه DSA)
کانتکست یک میلیون توکن، بومی
داده آموزش ۳٫۲۵ تریلیون توکن در سه مرحله
مدل پایه MiMo-V2.5 شیائومی
مجوز MIT
حجم وزن‌ها حدود ۳۱۵ گیگابایت

اگر با مفهوم پارامتر و معماری ترنسفورمر آشنا نیستید، پیش از ادامه توضیح ساده مدل زبانی بزرگ را بخوانید.

معماری: توجه پنجره‌ای به‌جای توجه کامل

مهم‌ترین نکته فنی این مدل این است که هیچ لایه توجه کاملی ندارد. در توجه کامل هر توکن به همه توکن‌های قبلی نگاه می‌کند و هزینه آن با بلندتر شدن متن به‌سرعت بالا می‌رود. Naive-N0.5-Flash به‌جای آن، عمدتاً با نسبت ۵ به ۱، دو نوع لایه را ترکیب کرده است:

  • توجه پنجره لغزان (Sliding-Window Attention): هر توکن فقط ۱۲۸ توکن نزدیک خود را می‌بیند.
  • توجه تُنُک DeepSeek (DeepSeek Sparse Attention): از کل متن، ۲۰۴۸ توکن برتر را برای توجه انتخاب می‌کند.

مدل در سه مرحله آموزش دیده است: ۵۰ میلیارد توکن برای گرم کردن بخش انتخاب‌گر (Indexer)، ۳ تریلیون توکن آموزش توجه تُنُک و ۲۰۰ میلیارد توکن برای کاهش نرخ یادگیری. NaiveAI در صفحه پژوهشی خود از تیم MiMo شیائومی برای انتشار عمومی مدل پایه تشکر کرده است.

ادعای «ساختن هوش مصنوعی با هوش مصنوعی»

عنوان گزارش NaiveAI «ساختن هوش مصنوعی پیشرو با هوش مصنوعی» است. به گفته شرکت، مدل‌های هوش مصنوعی معماری توجه ترکیبی را کاوش و طراحی کرده‌اند و سیستم‌های آموزش، استنتاج و استقرار را هم بهینه کرده‌اند. نمونه مشخص، موتور استنتاج NaiveRT است که به گفته شرکت «در شش روز توسط پژوهشگران انسانی همراه با مدل‌های هوش مصنوعی و در ۱۵۱ آزمایش بهینه‌سازی مستند» ساخته شده است.

خود NaiveAI می‌گوید پژوهشگران انسانی جهت کار، محدودیت‌ها و معیارها را تعیین کرده و تصمیم‌های کلیدی را گرفته‌اند. RuntimeWire در گزارش خود یادآوری می‌کند که شرکت روشن نکرده دقیقاً چه سهمی از کار را هوش مصنوعی انجام داده و این سهم را چطور سنجیده است.

بنچمارک‌ها و سرعت: ادعاهای خود شرکت

NaiveAI این نمره‌ها را برای کدنویسی گزارش کرده است: ۶۷٫۸ در DeepSWE v1.1، ۸۶٫۷ در Terminal-Bench 2.1 و ۷۳٫۶ در SWE-bench Pro. طبق صفحه پژوهشی، ارزیابی‌ها با Claude Code 2.1.207، کانتکست یک میلیون توکنی، دمای ۱٫۰ و top-p برابر ۰٫۹۵ انجام شده‌اند. این نمره‌ها هنوز به‌طور مستقل تأیید نشده‌اند.

درباره سرعت، شرکت از ۵۰ توکن در ثانیه برای هر کاربر در حالت Standard و تا ۲۰۰۰ توکن در ثانیه در حالت Ultrafast خبر می‌دهد. طبق صفحه پژوهشی، موتور NaiveRT در آزمون تک‌جریانی روی هشت GPU به اوج ۲۱۲۲ توکن در ثانیه رسیده است؛ این عدد فقط مرحله تولید (Decode) را بدون پردازش پرامپت می‌سنجد. API رسمی مدل هم با قیمت ۰٫۱۰ دلار برای هر میلیون توکن ورودی، ۰٫۴۰ دلار برای خروجی و ۰٫۰۱ دلار برای خواندن از کش عرضه شده است.

اجرای Naive-N0.5-Flash به چه سخت‌افزاری نیاز دارد؟

طبق کارت مدل، اجرای Naive-N0.5-Flash به GPUهای NVIDIA با پشتیبانی FP8 نیاز دارد. وزن‌ها به‌تنهایی حدود ۳۱۵ گیگابایت فضا می‌گیرند و استنتاج هم حافظه اضافی می‌خواهد. پس این مدلی نیست که مثل مدل‌های کوچک‌تر با Ollama روی کامپیوتر شخصی اجرا شود. نمونه بارگذاری با کتابخانه Transformers طبق کارت مدل:

pip install "transformers[torch,kernels]>=5.17.0"
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "NaiveAI/Naive-N0.5-Flash-FP8"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    trust_remote_code=True,
    dtype="auto",
    device_map="auto",
)

توجه کنید که trust_remote_code=True کد پایتون مخزن مدل را روی سیستم شما اجرا می‌کند؛ پیش از اجرا آن را بررسی کنید. به گفته NaiveAI، کد منبع NaiveRT، محیط Docker Compose و اسکریپت‌های بنچمارک قرار است تا ۱۲ اکتبر (۲۰ مهر) منتشر شوند.

چرا این خبر برای توسعه‌دهندگان مهم است؟

مجوز MIT یعنی می‌توانید مدل را تغییر دهید، روی زیرساخت خودتان میزبانی کنید و در محصول تجاری به کار ببرید. برای تیم‌هایی که نمی‌خواهند کد و داده‌شان از سرور خودشان خارج شود، یا به دلیل محدودیت پرداخت و دسترسی نمی‌توانند روی API سرویس‌های خارجی حساب کنند، یک مدل باز کدنویسی با کانتکست یک میلیونی گزینه‌ای است که ارزش بررسی دارد.

در مقابل، هزینه سخت‌افزار بالاست و نمره‌های اعلام‌شده فعلاً ادعای خود سازنده‌اند. پیشنهاد ما این است که پیش از هر تصمیمی، مدل را روی کارهای واقعی تیم خودتان بسنجید و منتظر ارزیابی‌های مستقل بمانید.

دیدگاه‌ها

۰/۲٬۰۰۰

دیدگاه‌ها پس از بررسی تحریریه منتشر می‌شوند. توهین، تبلیغ و لینک‌های بی‌ربط حذف می‌شوند؛ نقد فنی و مستند همیشه خوش‌آمد است.

$ comments --count۰

هنوز کسی چیزی ننوشته. اولین دیدگاه را شما ثبت کنید.

مطالب مرتبط