Ollama ابزاری متنباز است که مدلهای زبانی را با یک دستور روی ویندوز، مک یا لینوکس اجرا میکند؛ بدون API و بدون هزینه.
در لینوکس کافی است اسکریپت نصب رسمی را اجرا کنید؛ در ویندوز و مک هم فایل نصب را از سایت Ollama بگیرید.
دستور ollama run qwen3.5:4b مدل را دانلود میکند و بلافاصله در ترمینال با آن حرف میزنید.
حجم مدل باید در RAM یا VRAM جا شود. مدلهای ۲ تا ۴ میلیارد پارامتری روی لپتاپهای معمولی هم روان کار میکنند.
Ollama یک API سازگار با OpenAI دارد؛ کافی است base_url را به localhost:11434 تغییر دهید.
API سرور Ollama احراز هویت ندارد. اگر آن را روی شبکه باز میکنید، حتماً پشت فایروال یا پراکسی امن قرارش دهید.
آموزش Ollama از نصب تا استفاده در کد: مدلهای زبانی مثل Qwen و Gemma را رایگان، آفلاین و بدون ارسال داده به سرور خارجی روی سیستم خودتان اجرا کنید.