Kolibri-1؛ مدل ۷۸ میلیاردی Aleph Alpha با مجوز Apache 2.0
Aleph Alpha وزنهای Kolibri-1 را با مجوز Apache 2.0 روی Hugging Face منتشر کرد: ترکیب خبرگان ۷۸ میلیاردی، ۳٫۴۶ میلیارد پارامتر فعال و فقط دو زبان.

فهرست مطالب
شرکت آلمانی Aleph Alpha روز ۳ اکتبر ۲۰۲۶ (۱۱ مهر ۱۴۰۵)، همزمان با روز وحدت آلمان، وزنهای مدل Kolibri-1 را با مجوز Apache 2.0 روی Hugging Face منتشر کرد: یک مدل زبانی بزرگ از نوع ترکیب خبرگان (Mixture-of-Experts یا MoE) با ۷۸ میلیارد پارامتر که در هر توکن فقط ۳٫۴۶ میلیارد پارامتر آن فعال میشود. چیزی که شرکت روی آن تأکید میکند اندازه مدل نیست؛ ادعای حاکمیت دیجیتال آن است.
Kolibri-1 چه معماریای دارد؟
کارت مدل روی Hugging Face مشخصات را دقیق فهرست کرده است:
| ویژگی | مقدار |
|---|---|
| پارامتر کل | ۷۸٬۱۰۳٬۰۷۴٬۵۶۰ |
| پارامتر فعال در هر توکن | ۳٬۴۵۷٬۵۷۳٬۱۲۰ |
| لایهها | ۵۰ |
| خبرگان هر لایه | ۳۸۴ مسیریابیشده (۶ انتخابشده) + ۱ مشترک |
| اندازه نهان (Hidden Size) | ۲٬۵۶۰ |
| اندازه واژگان | ۱۲۸٬۰۰۰ |
| کانتکست آموزشدیده | ۲۶۲٬۱۴۴ توکن |
| حداکثر کانتکست | ۱٬۰۴۸٬۵۷۶ توکن (اکستراپولیشن) |
لایههای توجه با نسبت ۴ به ۱ بین توجه پنجرهای علّی (Causal Sliding-Window GQA) و توجه کامل علّی تقسیم شدهاند و پنجره، ۵۱۲ توکن پیشین بهعلاوه توکن جاری است. به نوشته وبلاگ Aleph Alpha، هر پنجمین لایه توجه کامل دارد و در چهار لایه دیگر هر توکن فقط ۵۱۲ توکن پیشین را میبیند. همین ترکیب، هزینه حافظه کانتکستهای بلند را پایین میآورد.
یک عدد جدول را با احتیاط بخوانید: رقم ۱٬۰۴۸٬۵۷۶ توکن آموزشدیده نیست و از اکستراپولیشن (Extrapolation) به دست میآید. خود شرکت برای کارهای پیچیده همان ۲۶۲٬۱۴۴ توکن را پیشنهاد میکند.
آموزش روی ۲۰ تریلیون توکن پیشآموزش، ۳٫۴۴ تریلیون توکن میانآموزش و ۲۰۱ میلیارد توکن ویژه کانتکست بلند انجام شده است. ترکیب داده حدود ۶۲٫۵ درصد انگلیسی، ۲۳٫۹ درصد آلمانی و ۱۳٫۶ درصد کد است؛ وبلاگ شرکت همین ترکیب را ۶۲، ۲۱٫۳ و ۱۴ درصد اعلام کرده و مبنای این گزارش، عدد کارت مدل است. زبانهای پشتیبانیشده هم فقط آلمانی و انگلیسیاند.
چطور Kolibri-1 را اجرا کنیم؟
پاسخ دو بخش دارد: سختافزاری که وزنها را جا میدهد، و دستوری که سرویس را بالا میآورد.
سختافزار لازم برای اجرای محلی
وزنها بهصورت float8_e4m3fn در بلوکهای ۱۲۸×۱۲۸ ذخیره شدهاند و فعالسازیها بهصورت دینامیک کوانتیزه میشوند؛ امبدینگ، سر زبانی (LM Head)، لایههای نرمالسازی و مسیریاب MoE در bfloat16 ماندهاند. حجم نهایی حدود ۷۸ گیگابایت است.
حداقل سختافزار: ۲ عدد A100 80GB، ۲ عدد H100 SXM5، یک H200، یک B200 یا یک B300. پیشنهاد شرکت: ۲ عدد H100 SXM5، ۲ عدد H200، یک B200 یا یک B300. Kolibri-1 مدل یک کارت گرافیک خانگی نیست؛ برای اجرای محلی روی سختافزار معمولی، راهنمای اجرای محلی مدل زبانی با Ollama گزینه واقعبینانهتری است.
راهاندازی سرویس با vLLM
کارت مدل برای حالت استدلالی (Reasoning) و فراخوانی ابزار، همین دستور را میدهد:
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
خروجی یک API سازگار با OpenAI است. برای روشن کردن استدلال، در کلاینت پایتون extra_body را با دیکشنری {"chat_template_kwargs": {"reasoning_effort": "high", "enable_thinking": True}} بفرستید. مقادیر پیشنهادی نمونهگیری: temperature=1.0، top_p=0.97 و top_k=128. همین سازگاری یعنی کلاینتهای موجود — مثلاً پایپلاین RAG با پایتون و Ollama — با تغییر base_url و نام مدل به آن وصل میشوند.
نتایج بنچمارکها: AIME، GPQA و کدنویسی
| بنچمارک | انگلیسی | آلمانی |
|---|---|---|
| AIME 2025 | ۹۶٫۹٪ | ۸۷٫۵٪ |
| GPQA Diamond | ۸۴٫۳٪ | ۸۱٫۳٪ |
| میانگین کدنویسی | ۸۹٫۳٪ | — |
| HumanEval+ | ۹۲٫۷٪ | — |
| LongBench Pro | ۶۴٫۵٪ | — |
| TerminalBench 2.1 | ۲۷٫۷٪ | — |
ردیفهایی که ستون آلمانیشان خالی است، در کارت مدل تفکیک زبانی ندارند؛ «میانگین کدنویسی» هم میانگین دسته کدنویسی در زبان انگلیسی است.
دو نکته در این جدول برجسته است: TerminalBench 2.1 که کارهای عاملمحور در خط فرمان را میسنجد روی ۲۷٫۷ درصد ایستاده، و AIME 2025 بین انگلیسی و آلمانی ۹٫۴ واحد اختلاف دارد. همه این ارقام را خود Aleph Alpha با چارچوب ارزیابی خودش منتشر کرده و ارزیابی مستقلی از بیرون شرکت هنوز در دسترس نیست.
ادعای حاکمیت دیجیتال Aleph Alpha
به نوشته وبلاگ Aleph Alpha، تیمهای این شرکت مدل را در آلمان ساختهاند و آن را روی زیرساختی در آلمان و فنلاند، زیر قانون اروپا و آلمان و «بدون کنترل خارجی» آموزش دادهاند. آموزش روی ۷۶۸ پردازنده گرافیکی NVIDIA B200 انجام شده است. شرکت از «یکپارچگی کامل زنجیره تأمین» هم میگوید: پاسخگویی برای هر تصمیم، از ورود داده تا پیشآموزش، پسآموزش و ارزیابی نهایی.
همه اینها ادعای خود شرکت است. چیزی که مستقل از آن قابل بررسی است، متن مجوز است: Apache 2.0 اجازه میدهد وزنها را بردارید، فاینتیون کنید و تجاری به کار ببرید — همان مسیری که مدل ۳۰۹ میلیاردی NaiveAI با وزن باز با مجوز MIT رفت. برای وزنهای وعدهدادهشده Mistral Large 4 هنوز هیچ مجوزی اعلام نشده است. مانع اصلی، صورتحساب سختافزار است: ۷۸ گیگابایت وزن FP8 حتی در حافظه یک DGX Spark 64GB جا نمیشود.




دیدگاهها
دیدگاهها پس از بررسی تحریریه منتشر میشوند. توهین، تبلیغ و لینکهای بیربط حذف میشوند؛ نقد فنی و مستند همیشه خوشآمد است.
هنوز کسی چیزی ننوشته. اولین دیدگاه را شما ثبت کنید.