ChatGPT বা Gemini এর প্রো ভার্সনের মাসিক খরচ এখন অনেকের জন্যই বোঝা। তার চেয়ে বড় অস্বস্তি অন্য জায়গায় — অফিসের রিপোর্ট, ক্লায়েন্টের ডেটা বা নিজের ব্যক্তিগত নোট কোনো কোম্পানির সার্ভারে পাঠাতে ইচ্ছে করে না। আর ইন্টারনেট বিভ্রাটের দিনে AI একেবারেই অচল হয়ে যায়।
এই তিনটা সমস্যার একটাই সমাধান — AI মডেলটাকে নিজের কম্পিউটারের ভেতরে নামিয়ে আনা। ২০২৬ সালে দাঁড়িয়ে এটা আর গবেষকদের ব্যাপার নয়। একটা সাধারণ ৮ থেকে ১৬ জিবি RAM এর ল্যাপটপেই এমন মডেল চলে, যেগুলো দুই বছর আগের সেরা ক্লাউড মডেলের কাছাকাছি কাজ করে। খরচ শূন্য, ইন্টারনেট লাগে না, কোনো রেট লিমিট নেই, আর আপনার লেখা একটা অক্ষরও কম্পিউটার ছেড়ে বাইরে যায় না।
এই টিউনে একেবারে শূন্য থেকে শুরু করে ইনস্টল, মডেল বাছাই, ছবি বিশ্লেষণ, নিজের ডকুমেন্ট নিয়ে চ্যাট, API দিয়ে নিজের অ্যাপ বানানো আর পারফরম্যান্স টিউনিং পর্যন্ত পুরোটা ধরে ধরে দেখাব। কোনো প্রোগ্রামিং জ্ঞান লাগবে না, কপি পেস্ট করতে পারলেই হবে।
চার কারণে লোকাল AI এখন বাস্তবসম্মত। এক, প্রাইভেসি। প্রম্পট আপনার মেশিনেই থাকে, তাই মেডিকেল রিপোর্ট, চুক্তিপত্র বা ছাত্রছাত্রীর তথ্য নিয়ে কাজ করতে ভয় নেই। দুই, খরচ। একবার মডেল নামালে আর কোনো সাবস্ক্রিপশন নেই, টোকেনের হিসাব নেই। তিন, প্রাপ্যতা। ইন্টারনেট না থাকলেও কাজ চলে, লোডশেডিংয়ের সময় ল্যাপটপের ব্যাটারিতেই চলে। চার, নিয়ন্ত্রণ। মডেল হঠাৎ বদলে যায় না, উত্তর দিতে অস্বীকার করে না, আর একই ইনপুটে ধারাবাহিক ফল দেয়।
তবে সৎভাবে বলা দরকার, কোথায় লোকাল AI পিছিয়ে। সবচেয়ে বড় ক্লাউড মডেলগুলোর ধার এখনো বেশি, বিশেষ করে খুব জটিল যুক্তি, লম্বা কোডবেস বিশ্লেষণ বা সর্বশেষ ঘটনার তথ্য জানার ক্ষেত্রে। লোকাল মডেল ইন্টারনেট ব্রাউজ করে না, তাই তার জ্ঞান ট্রেনিং পর্যন্তই সীমিত। আর ছোট মডেল বেশি ভুল বলে, সেটা মেনে নিয়েই কাজ করতে হবে।
প্যারামিটার (b): মডেলের নামের শেষে 4b বা 27b মানে ৪ বিলিয়ন বা ২৭ বিলিয়ন প্যারামিটার। বড় মানে সাধারণত বেশি বুদ্ধিমান, কিন্তু বেশি মেমোরি ও ধীর গতি।
কোয়ান্টাইজেশন: মডেলের ওজনগুলোকে কম নির্ভুলতায় চেপে রাখা, যাতে ফাইল ছোট হয় ও কম RAM এ চলে। গুণমান কিছুটা কমে, কিন্তু সাধারণ কাজে পার্থক্য প্রায় বোঝা যায় না। Ollama ডিফল্টভাবেই কোয়ান্টাইজড ভার্সন দেয়।
কনটেক্সট উইন্ডো: মডেল একবারে কত টেক্সট মনে রাখতে পারে। নতুন মডেলগুলোতে এটা ১২৮ হাজার থেকে ২৫৬ হাজার টোকেন পর্যন্ত, অর্থাৎ পুরো একটা বই ধরে আলোচনা করা সম্ভব। তবে বড় কনটেক্সট মানে বেশি RAM খরচ।
টোকেন ও গতি: টোকেন হলো শব্দের টুকরো। গতি মাপা হয় প্রতি সেকেন্ডে কত টোকেন লেখা হচ্ছে তা দিয়ে। পড়ার আরামের জন্য সেকেন্ডে ১৫ টোকেনের বেশি হলেই যথেষ্ট।
VRAM বনাম RAM: গ্রাফিক্স কার্ড থাকলে মডেল তার VRAM এ ঢোকে এবং কয়েক গুণ দ্রুত চলে। GPU না থাকলে সাধারণ RAM ও প্রসেসরেই চলে, শুধু ধীর হয়। অর্থাৎ গেমিং পিসি না থাকলেও আপনি বাদ পড়ছেন না।
নিচের টেবিলটাই এই টিউনের সবচেয়ে কাজের অংশ। মডেলের ফাইল সাইজের চেয়ে অন্তত ২ জিবি বেশি ফ্রি মেমোরি থাকা দরকার, কারণ কনটেক্সট আর সিস্টেম নিজেও কিছু জায়গা নেয়।
| আপনার পিসি | যে মডেল বেছে নিন | ডাউনলোড সাইজ | বাস্তব অভিজ্ঞতা |
|---|---|---|---|
| ৮ জিবি RAM, GPU নেই | qwen3.5:0.8b বা qwen3.5:2b | ১.০ থেকে ২.৭ জিবি | অনুবাদ, ইমেইল লেখা, সারসংক্ষেপ ভালো চলে |
| ১৬ জিবি RAM, GPU নেই | qwen3.5:4b | ৩.৪ জিবি | দৈনন্দিন কাজের জন্য সেরা ভারসাম্য |
| ১৬ জিবি RAM, ৬ থেকে ৮ জিবি VRAM | qwen3.5:9b বা gemma4:12b | ৬.৬ থেকে ৭.৬ জিবি | কোড, যুক্তি ও ছবি বিশ্লেষণে বেশ শক্তিশালী |
| ৩২ জিবি RAM, ১২ জিবি VRAM | gpt-oss:20b বা qwen3.5:27b | ১৭ জিবির কাছাকাছি | জটিল কাজেও ক্লাউডের কাছাকাছি ফল |
| ৬৪ জিবি RAM, ২৪ জিবি VRAM | qwen3.5:35b বা gemma4:31b | ২০ থেকে ২৪ জিবি | প্রায় প্রফেশনাল গ্রেড, তবে বিদ্যুৎ ও তাপ বেশি |
মডেলগুলো ডিফল্টভাবে সি ড্রাইভে জমা হয়, তাই আগে অন্তত ২০ থেকে ৩০ জিবি জায়গা খালি রাখুন। কীভাবে অন্য ড্রাইভে সরাবেন, সেটা ১১ নম্বর অংশে বলেছি।
দুটো পথ আছে। সহজ পথ হলো ollama.com/download থেকে ইনস্টলার নামিয়ে ডাবল ক্লিক করা। যাঁরা টার্মিনাল পছন্দ করেন, তাঁরা PowerShell খুলে এই এক লাইনেই কাজ শেষ করতে পারেন:
irm https://ollama.com/install.ps1 | iexএর জন্য Windows 10 বা তারপরের ভার্সন লাগবে। ইনস্টলের পর ট্রেতে Ollama আইকন দেখতে পাবেন, অর্থাৎ ব্যাকগ্রাউন্ডে সার্ভিসটি চালু আছে।
ollama.com/download থেকে অ্যাপটি নামিয়ে Applications ফোল্ডারে টেনে দিন। অ্যাপল সিলিকনের ম্যাকে MLX ভার্সনের মডেলগুলো বেশি দ্রুত চলে, নামের শেষে mlx লেখা ট্যাগগুলোই সেই ভার্সন।
টার্মিনালে ollama.com/download/linux পেজে দেওয়া ইনস্টল স্ক্রিপ্টটি চালালেই হয়। সার্ভার হিসেবে চালাতে চাইলে systemd সার্ভিস হিসেবেই সেট হয়ে যায়।
টার্মিনাল বা PowerShell খুলে লিখুন:
ollama run qwen3.5:4bপ্রথমবার মডেল ডাউনলোড হবে, এরপর সরাসরি প্রম্পট চলে আসবে। বাংলায় লিখেও প্রশ্ন করতে পারেন। বেরিয়ে আসতে /bye লিখুন। প্রয়োজনীয় কমান্ডগুলো এক নজরে:
| কমান্ড | কাজ |
|---|---|
| ollama run নাম | মডেল চালু করে চ্যাট শুরু |
| ollama pull নাম | শুধু ডাউনলোড, চালু নয় |
| ollama list | কোন কোন মডেল নামানো আছে |
| ollama ps | এখন কোন মডেল মেমোরিতে চলছে |
| ollama stop নাম | মেমোরি থেকে সরিয়ে দেয় |
| ollama rm নাম | মডেল ডিলিট করে জায়গা খালি করে |
| মডেল | সাইজ অপশন | বিশেষত্ব | যে কাজে সেরা |
|---|---|---|---|
| qwen3.5 | 0.8b থেকে 122b | টেক্সট ও ছবি দুটোই বোঝে, ২৫৬ হাজার টোকেন কনটেক্সট, ২০০ এর বেশি ভাষা | সাধারণ সব কাজ, বাংলা লেখা, অনুবাদ, দীর্ঘ ডকুমেন্ট |
| gemma4 | e2b, e4b, 12b, 26b, 31b | গুগলের ওপেন মডেল, ভিশন ও থিংকিং মোড, ছোট ভার্সনগুলো ডিভাইসের জন্যই বানানো | ল্যাপটপে হালকা কিন্তু বুদ্ধিমান সহকারী |
| gpt-oss | 20b, 120b | ওপেনএআইয়ের ওপেন ওয়েট মডেল, রিজনিং ও এজেন্টিক কাজে শক্তিশালী | ধাপে ধাপে সমস্যা সমাধান, টুল ব্যবহার |
| deepseek-r1 | 1.5b থেকে 671b | রিজনিং মডেল, উত্তরের আগে নিজে চিন্তা করে | গণিত, লজিক, ধাঁধা |
| qwen3-coder | 30b, 480b | কোডিং ও এজেন্ট কাজের জন্য বিশেষভাবে তৈরি | বড় প্রজেক্টে কোড লেখা ও রিফ্যাক্টর |
| qwen2.5-coder | 0.5b থেকে 32b | কম রিসোর্সে ভালো কোড সাজেশন | পুরোনো ল্যাপটপে কোড সহকারী |
| nomic-embed-text | ছোট | এমবেডিং মডেল, চ্যাট করে না | নিজের ফাইল সার্চ ও RAG |
শুরু করার জন্য আমার পরামর্শ সহজ — একটা সাধারণ কাজের মডেল (qwen3.5 বা gemma4) আর একটা কোডের মডেল রাখুন, ব্যস। ডজনখানেক মডেল নামিয়ে ডিস্ক ভরিয়ে ফেলার কোনো মানে নেই।
qwen3.5 আর gemma4 দুটোই মাল্টিমোডাল, অর্থাৎ ছবি বুঝতে পারে। চ্যাট চলাকালীন ছবির ফাইল পাথ প্রম্পটে দিলে সে ছবিটা পড়ে নেয়। যেমন বিদ্যুৎ বিলের ছবি দিয়ে জিজ্ঞেস করতে পারেন কোন খাতে কত টাকা, বা হাতে লেখা নোটের ছবি দিয়ে টাইপ করে দিতে বলতে পারেন। পুরো কাজটা আপনার মেশিনেই হয়, তাই ব্যক্তিগত কাগজপত্রের ছবি কোথাও আপলোড করার ঝুঁকি নেই।
থিংকিং মোড সাপোর্ট করা মডেলে উত্তর দেওয়ার আগে মডেল নিজে ধাপে ধাপে ভাবে। এতে গণিত বা যুক্তির প্রশ্নে নির্ভুলতা বাড়ে, কিন্তু উত্তর আসতে সময় বেশি লাগে। সাধারণ প্রশ্নে থিংকিং দরকার নেই, জটিল প্রশ্নে চালু রাখুন।
Ollama এর ডেস্কটপ অ্যাপেই সাধারণ চ্যাট উইন্ডো আছে, ইনস্টলের পর সেটাই সবচেয়ে সহজ রাস্তা। এর বাইরে দুটো জনপ্রিয় পথ আছে। এক, Open WebUI নামের ওপেন সোর্স ইন্টারফেস, যা ব্রাউজারে পরিচিত চ্যাট অভিজ্ঞতা দেয় এবং একাধিক মডেলের মধ্যে সুইচ করতে দেয়। দুই, কোড এডিটরের এক্সটেনশন, যেখানে লোকাল মডেলকেই কোড সহকারী হিসেবে যোগ করা যায়।
মডেল পেজে দেখানো ollama launch কমান্ড দিয়ে কিছু জনপ্রিয় এজেন্ট অ্যাপ সরাসরি লোকাল মডেলের সঙ্গে চালানো যায়। যাঁরা Java শিখছেন বা Git ও GitHub নিয়ে কাজ করছেন, তাঁদের জন্য এটা বিশেষভাবে কাজে দেবে — এরর মেসেজ পেস্ট করে ব্যাখ্যা চাওয়া যায়, ইন্টারনেট বা টোকেনের খরচ ছাড়াই।
Ollama চালু থাকলে আপনার কম্পিউটারেই একটা লোকাল সার্ভার চলে, ঠিকানা localhost এর 11434 পোর্ট। ফলে যেকোনো ভাষা থেকে সাধারণ HTTP রিকোয়েস্ট পাঠিয়ে উত্তর নেওয়া যায়। উদাহরণ:
curl http://localhost:11434/api/chat -d '{"model": "qwen3.5:4b", "messages": [{"role":"user", "content":"বাংলায় তিন লাইনে ব্যাখ্যা করো DNS কী"}], "stream": false}'পাইথনে একই কাজ:
import requests
r = requests.post("http://localhost:11434/api/chat", json={"model": "qwen3.5:4b", "messages": [{"role": "user", "content": "একটি ইমেইল লিখে দাও"}], "stream": False})
print(r.json()["message"]["content"])এই সুবিধার কারণেই লোকাল AI ডেভেলপারদের কাছে এত জনপ্রিয় — কোনো API কি, কোনো বিল, কোনো রেট লিমিট নেই। নিজের ব্লগের জন্য অটো সামারি জেনারেটর, ইনভয়েস পড়ার স্ক্রিপ্ট বা বাংলা বানান সংশোধনের টুল বানানো যায় এক সন্ধ্যায়।
মডেল আপনার ফাইল চেনে না, তাই আগে ফাইলগুলোকে সংখ্যায় রূপ দিতে হয়, যাকে বলে এমবেডিং। কাজের ধারা সহজ। প্রথমে ollama pull nomic-embed-text দিয়ে এমবেডিং মডেল নামান। তারপর আপনার পিডিএফ বা টেক্সট ফাইলগুলোকে ছোট ছোট টুকরো করে সেই মডেল দিয়ে ভেক্টরে পরিণত করে একটা ভেক্টর ডেটাবেজে রাখুন। প্রশ্ন করলে সিস্টেম আগে সবচেয়ে মিলে যাওয়া টুকরোগুলো খুঁজে বের করে, তারপর সেগুলো চ্যাট মডেলকে দিয়ে উত্তর লেখায়। এই পদ্ধতিকে বলে RAG।
ভয়ের কিছু নেই, Open WebUI এর মতো টুলে এই কাজটা ফাইল আপলোড করার মতোই সহজ, কোড লিখতে হয় না। শিক্ষার্থীদের জন্য এটা দুর্দান্ত — সেমিস্টারের সব লেকচার নোট এক জায়গায় রেখে প্রশ্ন করা যায়, আর ডেটা কোথাও যায় না। মডেল ও ভেক্টর ডেটাবেজের ফোল্ডার মাঝে মাঝে ব্যাকআপ রাখতে ভুলবেন না, চাইলে Robocopy ও Task Scheduler দিয়ে অটোমেটিক ব্যাকআপ সিস্টেমটাই কাজে লাগাতে পারেন।
দুই বছর আগে লোকাল মডেলে বাংলা লেখা প্রায় হাস্যকর ছিল। এখন ছবিটা বদলেছে। নতুন প্রজন্মের মডেলগুলো দুই শতাধিক ভাষা কভার করার দাবি করে এবং বাংলায় ইমেইল, সারসংক্ষেপ, অনুবাদ ও সাধারণ ব্যাখ্যা ভালোই লেখে। তবু দুটো বাস্তব পরামর্শ। এক, খুব ছোট মডেলে বাংলা যুক্তাক্ষরে মাঝে মাঝে ভুল আসে, তাই অন্তত 4b আকারের মডেল ব্যবহার করুন। দুই, নির্ভুলতা দরকার হলে প্রম্পটে একটা নমুনা দিন, কোন ধাঁচে লিখতে হবে দেখিয়ে দিন। এতে ফল অনেক ভালো হয়।
লোকাল মডেল মানেই সব নিরাপদ, এমন ভাবা ভুল। তিনটা জিনিস মনে রাখুন। এক, 11434 পোর্টটি কখনো ইন্টারনেটে খুলে দেবেন না, তাহলে যে কেউ আপনার মডেল ব্যবহার করতে পারবে; রাউটারে পোর্ট ফরওয়ার্ড না করাই নিরাপদ। দুই, মডেল আত্মবিশ্বাসের সঙ্গে ভুল তথ্য দিতে পারে, বিশেষ করে সাল, আইন বা চিকিৎসা সংক্রান্ত প্রশ্নে; গুরুত্বপূর্ণ কিছু হলে যাচাই করুন। তিন, মডেলের জ্ঞান তার ট্রেনিং সময় পর্যন্তই, তাই আজকের খবর সে জানে না।
| সমস্যা | কারণ | সমাধান |
|---|---|---|
| মডেল লোড হতে গিয়ে মেমোরি এরর | মডেল আপনার RAM বা VRAM এর চেয়ে বড় | ছোট সাইজের ট্যাগ নিন, কনটেক্সট কমান, অন্য অ্যাপ বন্ধ করুন |
| খুব ধীরে উত্তর আসছে | মডেল CPU তে চলছে বা সাইজ বড় | ছোট মডেল বেছে নিন, GPU ড্রাইভার আপডেট করুন |
| model not found | ট্যাগের নাম ভুল | ollama list দিয়ে সঠিক নাম দেখে নিন |
| পোর্ট ইতিমধ্যে ব্যবহৃত | আগের একটি সার্ভিস চলছে | ট্রে থেকে Ollama বন্ধ করে আবার চালু করুন |
| ডাউনলোড বার বার আটকে যাচ্ছে | অস্থির ইন্টারনেট | একই কমান্ড আবার চালান, যেখানে ছিল সেখান থেকেই এগোবে |
| বাংলা উত্তরে অক্ষর ভাঙা | টার্মিনালের ফন্ট বা এনকোডিং | Windows Terminal ব্যবহার করুন বা গ্রাফিকাল ইন্টারফেসে চালান |
মডেল আর সফটওয়্যার ফ্রি। খরচ কেবল বিদ্যুৎ আর ডিস্কের জায়গা।
হ্যাঁ। শুধু প্রথমবার মডেল নামাতে ইন্টারনেট লাগে, এরপর অফলাইনেই চলে।
যায়, তবে অভিজ্ঞতা সীমিত। খুব ছোট মডেল কিছু অ্যাপে চলে, কিন্তু ল্যাপটপের ধারেকাছে আসে না।
দৈনন্দিন লেখা, অনুবাদ, সারসংক্ষেপ, কোড ব্যাখ্যা — এসবে যাবে। খুব জটিল যুক্তি বা সর্বশেষ তথ্যের দরকার হলে ক্লাউড মডেলই এগিয়ে।
হবে, 2b বা 4b মডেল দিয়ে শুরু করুন। ধীর হবে, কিন্তু কাজ চলবে।
দুই বছর আগে নিজের কম্পিউটারে AI চালানো ছিল শখের ব্যাপার। এখন এটা কাজের হাতিয়ার — বিনা খরচে, নিজের ডেটা নিজের কাছে রেখে। শুরুটা করুন ছোট করে: একটা 4b মডেল নামান, এক সপ্তাহ নিজের আসল কাজে ব্যবহার করুন, তারপর বুঝবেন বড় মডেল আদৌ দরকার কি না।
আপনার পালা। আপনার পিসির RAM আর গ্রাফিক্স কার্ড কত, আর কোন মডেলটা চালিয়ে দেখলেন — টিউমেন্টে জানান। কোন কনফিগারেশনে সেকেন্ডে কত টোকেন গতি পাচ্ছেন সেটাও লিখুন, তাতে নতুনদের মডেল বাছাই সহজ হবে। কোথাও আটকে গেলে সমস্যা লিখুন, আমি ধরে ধরে সমাধান বলে দেব।
আমি নাছিরুল হক। বিশ্বের সর্ববৃহৎ বিজ্ঞান ও প্রযুক্তির সৌশল নেটওয়ার্ক - টেকটিউনস এ আমি 2 দিন 21 ঘন্টা যাবৎ যুক্ত আছি। টেকটিউনস আমি এ পর্যন্ত 19 টি টিউন ও 0 টি টিউমেন্ট করেছি। টেকটিউনসে আমার 0 ফলোয়ার আছে এবং আমি টেকটিউনসে 0 টিউনারকে ফলো করি।
আমি নাছিরুল হক। প্রোগ্রামিং আর প্রযুক্তি নিয়ে ঘাঁটাঘাঁটি করতে ভালোবাসি। টেকটিউনসে মূলত Java প্রোগ্রামিং নিয়ে ধাপে ধাপে হাতে কলমে টিউটোরিয়াল লিখি — JDK ইনস্টল ও এনভায়রনমেন্ট সেটআপ থেকে শুরু করে IntelliJ IDEA, Exception Handling, OOP, Java Swing ও ফাইল হ্যান্ডলিং পর্যন্ত। এছাড়া স্মার্টফোন, ব্যাটারি ও নেটওয়ার্ক নিয়ে সহজ ভাষায় ব্যাখ্যামূলক...