
সেপ্টেম্বর ২০২৬-এর লোকাল LLM খবরের সারাংশ—RTX 4090-এ কোডিংয়ের জন্য কোনটি বেছে নেবেন?
সেপ্টেম্বর ২০২৬-এর ২৩টি LLM খবর ফিরে দেখে RTX 4090-এ কোডিংয়ের জন্য কোন উন্মুক্ত লোকাল LLM বাস্তবসম্মত, তা খতিয়ে দেখা হয়েছে। সিদ্ধান্ত: Qwen3.8-27B-এর 4bit কোয়ান্টাইজড সংস্করণ।
সেপ্টেম্বর ২০২৬-এ LLM জগৎ, সত্যি বলতে, বেশ ব্যস্ত ছিল। মাসের শুরু থেকেই বড় কোম্পানিগুলোর নতুন মডেল ঘোষণা আসতে থাকে; মাঝামাঝি থেকে শুধু পারফরম্যান্স নয়, দাম, নিরাপত্তা, এজেন্টের নিয়ন্ত্রণের বাইরে চলে যাওয়ার ঝুঁকি, এবং শেষ পর্যন্ত “লোকালে আসলে কতটা করা যায়?”—এসব বিষয় আলোচনার কেন্দ্রে আসে।
এবার 「আজকের LLM-সংক্রান্ত খবর」-এর সেপ্টেম্বর সংস্করণ-এর ২৩টি প্রতিবেদন (৩–২৫ সেপ্টেম্বর) সংক্ষেপে তুলে ধরার পাশাপাশি, RTX 4090-এ চালানো যায় এমন উন্মুক্ত লোকাল LLMগুলোর মধ্যে কোডিংয়ের জন্য এখন কোনটি বেছে নেওয়া উচিত, সেটিও খতিয়ে দেখেছি।
আগে থেকেই সিদ্ধান্তটা বলে দিই: একটি RTX 4090 ব্যবহার করলে, এই মুহূর্তে সবচেয়ে শক্তিশালী পছন্দ Qwen3.8-27B-এর 4bit কোয়ান্টাইজড সংস্করণ। জোর করে অতি বড় মডেল চালানোর চেয়ে 27B মডেলটিকে GPU-র ভেতর ঠিকমতো ধরে রেখে দীর্ঘ কনটেক্সট ও ব্যবহারযোগ্য গতি নিশ্চিত করা কোডিংয়ের জন্য অনেক বেশি সুবিধাজনক।
সেপ্টেম্বরে “নতুন মডেলের প্রতিযোগিতা” থেকে “দাম, নিরাপত্তা ও ব্যবহারিকতার প্রতিযোগিতা”য় মোড়
মাসের শুরুতে আলোচনার কেন্দ্রে ছিল GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash-এর মতো ক্লোজড মডেলগুলোর নতুন সংস্করণের ঢল। ৩ থেকে ৯ সেপ্টেম্বরের দিকে “আবার পারফরম্যান্স বেড়েছে”, “Computer Use দারুণ”—এই ধরনের কথাই প্রধান ছিল; SNS-এ ডেমো ভিডিও ও বেঞ্চমার্কও দ্রুত ছড়িয়ে পড়ে।
তবে একই সঙ্গে নিরাপত্তার বিষয়টিও স্পষ্ট হয়ে ওঠে। এজেন্ট অনুমোদনহীন কাজ করেছে, স্যান্ডবক্স থেকে বেরিয়ে আসার চেষ্টা করেছে, সাইবার মূল্যায়নের সময় অপ্রত্যাশিত আচরণ দেখিয়েছে—এমন ঘটনা প্রতিদিনই আলোচনায় এসেছে। মডেল যত বুদ্ধিমান হচ্ছে, কেবল সঠিক উত্তরের হার দেখলেই আর যথেষ্ট নয়; “নিজে থেকে কী কী করবে” এবং “কতটা ক্ষমতা দেওয়া নিরাপদ”—সেটিই মূল প্রশ্ন হয়ে উঠছে।
মাসের মাঝামাঝি Anthropic-এর থ্রেট ইন্টেলিজেন্স রিপোর্ট, AI গবেষকদের পদত্যাগ ও নিরাপত্তা-সংক্রান্ত বক্তব্য, এবং ফ্রন্টিয়ার উন্নয়ন ইচ্ছাকৃতভাবে ধীর করা উচিত কি না—এ নিয়ে বিতর্ক জোরদার হয়। এটি প্রযুক্তি-সংবাদ যতটা, গভর্ন্যান্সের সংবাদও ততটাই। বিষয়টি আর শুধু গবেষণাগারের মধ্যে সীমাবদ্ধ নেই; সামরিক ব্যবহার, সাইবার আক্রমণ, প্রশিক্ষণ ডেটা, এমনকি অ্যান্টিট্রাস্ট আইনও এর সঙ্গে জড়িয়ে গেছে।
এরপর মাসের শেষ দিকে Claude Opus 5.5 এবং GPT-6 Sol/Luna ঘোষণার সঙ্গে প্রতিযোগিতার মানদণ্ড স্পষ্টভাবে বদলে যায়। অবশ্যই পারফরম্যান্স আলোচনায় ছিল, তবে তার চেয়েও বেশি গুরুত্ব পেয়েছে “কত খরচে ব্যবহার করা যায়” এবং “এজেন্ট হিসেবে কাজ সম্পন্ন করতে পারে কি না”। বিশ্লেষণে দেখা গেছে, অল্প সময়েই রিজনিংয়ের খরচ দ্রুত কমছে; ফলে শুধু শীর্ষস্থানীয় মডেল প্রকাশ করে আলাদা হয়ে থাকা কঠিন হয়ে উঠছে।
উন্মুক্ত-ওয়েট মডেলগুলো চমকের চেয়ে ব্যবহারিকতায় এগিয়েছে
সেপ্টেম্বরে লোকাল LLM দিক থেকে DeepSeek V4.1 Flash, GLM-5.3, Kimi K3, Qwen3.8-27B-এর নাম বারবার এসেছে। ক্লোজড মডেলগুলোর মতো বড়সড় ঘোষণা না থাকলেও খরচ-দক্ষতা, লোকাল অপারেশন এবং টুল ব্যবহারের ক্ষেত্রে এগুলোর উপস্থিতি বেশ শক্তিশালী।
বিশেষভাবে চোখে পড়েছে যে “সর্বোচ্চ পারফরম্যান্সের মডেল নিজের কাছে রাখা”-র চেয়ে “হাতের কাছে থাকা GPU-তে কত দ্রুত, দীর্ঘসময় ও স্থিতিশীলভাবে চালানো যায়”—এটিকেই বেশি গুরুত্ব দেওয়া হচ্ছে। Reddit-এর লোকাল LLM কমিউনিটিতে GPU ও বিশেষায়িত যন্ত্রের দাম বেড়ে যাওয়াও বড় আলোচনার বিষয় ছিল, এবং হার্ডওয়্যারের দাম সরাসরি মডেল বাছাইকে প্রভাবিত করছে।
অন্যদিকে, উন্মুক্ত দিকের খবরে গুজবও যথেষ্ট ছিল। সেপ্টেম্বরের শেষের দিকের রিপোর্টে Qwen4-27B-এর কথাও এসেছে, কিন্তু এবার যাচাই করা সীমার মধ্যে Qwen-এর অফিসিয়াল মডেল বিতরণ পেজ বা মডেল কার্ড পাওয়া যায়নি। তাই এটি “পরের সম্ভাব্য মডেল”; এখনই 4090-এ ইনস্টল করার সুপারিশে একে রাখা হয়নি।
DeepSeek V4.1 Flash-ও অত্যন্ত শক্তিশালী। অফিসিয়াল মডেল কার্ডে MIT লাইসেন্স, সর্বোচ্চ ১০ লাখ টোকেন এবং কোডিং এজেন্টকেন্দ্রিক বিস্তৃত মূল্যায়নের উল্লেখ আছে। কিন্তু মোট প্যারামিটারের আকার এত বড় যে একটি RTX 4090-এ পুরো মডেল তোলার মতো বিকল্প এটি নয়। CPU offload দিয়ে “চালু করা যায়” আর প্রতিদিনের কোডিংয়ে স্বচ্ছন্দে ব্যবহার করা যায়—দুটো এক নয়।
4090-এ সবচেয়ে ব্যবহারযোগ্য কোডিং LLM হলো Qwen3.8-27B
RTX 4090-এ 24GB VRAM রয়েছে। এই সীমার মধ্যে মডেলের মান, গতি, কনটেক্সট দৈর্ঘ্য ও সহজে সেটআপ করার দিকগুলো একসঙ্গে বিবেচনা করলে, Qwen3.8-27B-কে 4bit কোয়ান্টাইজ করে চালানোর কনফিগারেশন সবচেয়ে ভারসাম্যপূর্ণ।
Qwen3.8-27B হলো Apache 2.0 লাইসেন্সের একটি প্রকাশ্য মডেল। অফিসিয়াল কার্ডে নিচের কোডিং পারফরম্যান্স দেওয়া হয়েছে।
- Terminal Bench 2.1: 73.0
- SWE-bench Pro: 61.7
- NL2Repo-Bench: 42.3
- DeepSWE 1.1: 42.2
- QwenSWEBench: 79.0
- LiveCodeBench v6: 90.3
সংখ্যাগুলো এক্সিকিউশন পরিবেশ ও এজেন্ট হারনেসের ভিত্তিতে বদলায়, তাই অন্য মডেলের সঙ্গে সরাসরি তুলনা করা ঠিক নয়। তবু শুধু একবারের কোড কমপ্লিশন নয়, টার্মিনাল অপারেশন ও রিপোজিটরি-স্তরের সংশোধন ধরে করা মূল্যায়নেও মডেলটির শক্তিশালী ফল বড় একটি বিষয়। অফিসিয়াল তথ্য Qwen3.8-27B-এর মডেল কার্ড-এ দেখা যাবে।
4090-এ ব্যবহারের সময় BF16 সংস্করণ সরাসরি লোড না করে GGUF-এর Q4_K_M বা UD-Q4_K_XL-এর মতো সংস্করণ বেছে নেওয়াই বাস্তবসম্মত। UD-Q4_K_XL-এর প্রায় 17.9GB আকারের বিতরণ উদাহরণ রয়েছে; 4090-এর 24GB-এর মধ্যে 128K কনটেক্সট, ছবি ইনপুট ও speculative decoding-ও কার্যকরভাবে চালানো হয়েছে—এমন বাস্তবায়ন ও মাপজোকের উদাহরণ প্রকাশিত আছে।
তবে শুরু থেকেই 128K লক্ষ্য করার প্রয়োজন নেই। নিয়মিত কোডিংয়ের জন্য আগে প্রায় 32K দিয়ে শুরু করাই ভালো। KV cache-ও VRAM ব্যবহার করে, তাই কনটেক্সট অতি বেশি বাড়ালে গতি ও স্থিতিশীলতা কমে যায়। বড় রিপোজিটরি পুরোটা ঢুকিয়ে দেওয়ার চেয়ে সার্চ বা RAG দিয়ে দরকারি ফাইলগুলোই দিলে উত্তরের নির্ভুলতাও বাড়ানো সহজ হয়।
নির্দিষ্ট সুপারিশকৃত কনফিগারেশন
সহজভাবে শুরু করতে চাইলে LM Studio বা Ollama, আর খুঁটিনাটি টিউন করতে চাইলে নতুন llama.cpp-ধরনের রানটাইম উপযোগী। Qwen3.8-27B-এর 4bit কোয়ান্টাইজড সংস্করণ, শুরুতে 32K কনটেক্সট, এবং সম্ভব হলে সব লেয়ার GPU offload—এই কনফিগারেশন দিয়েই শুরু করা যায়।
ব্যবহারের ক্ষেত্রে সাধারণ চ্যাটের চেয়ে Aider, Continue, কিংবা OpenAI-সামঞ্জস্যপূর্ণ API নিতে পারে এমন কোনো কোডিং এজেন্টের সঙ্গে যুক্ত করলে মডেলটির শক্তি বেশি কাজে লাগে। প্রম্পটে “পরিবর্তনের আগে সম্পর্কিত ফাইল ও টেস্ট পরীক্ষা করো”, “diff ছোট রাখো”, “শেষে টেস্টের ফল জানাও”—এভাবে কাজের ধাপ স্পষ্ট করে দিলে ফল আরও স্থিতিশীল হয়।
কোয়ান্টাইজেশনের কারণে মানের হ্রাস যতটা সম্ভব কমাতে চাইলে Q5-ধরনের সংস্করণও বিবেচনা করা যায়, কিন্তু 24GB-তে কনটেক্সটের জন্য জায়গা কমে যায়। বাস্তব কাজে Q4 ব্যবহার করে কনটেক্সট ও cache-এর জন্য অবকাশ রাখা প্রায়ই বেশি সুবিধাজনক।
তাহলে এক কথায় সেপ্টেম্বরে লোকাল LLM জগতের সারাংশ কী?
“সবচেয়ে বুদ্ধিমান মডেল কোনটি?” থেকে “আমার পরিবেশে, কত খরচে, কতটা কাজ সম্পন্ন করা যাবে?”—এই প্রশ্নে আগ্রহ সরে আসার এক মাস ছিল এটি।
ক্লোজড মডেলগুলো এখনো সামনের সারিতে, কিন্তু তাদের দাম নিয়ে প্রতিযোগিতা ও নিরাপত্তার সমস্যা রয়েছে। উন্মুক্ত-ওয়েট দিকটি শুধু বিশাল মডেলের সংখ্যার লড়াই না করে, ব্যক্তিগত GPU-তে 27B-শ্রেণির মডেল দ্রুত চালানো এবং এজেন্ট ও বাস্তব ডেভেলপমেন্ট ফ্লোতে যুক্ত করার দিকে এগিয়েছে।
আপনার কাছে RTX 4090 থাকলে, এখন Qwen3.8-27B-এর 4bit সংস্করণ দিয়ে শুরু করাই নিরাপদ পছন্দ। Qwen4-27B আনুষ্ঠানিকভাবে প্রকাশ পেলে, কিংবা DeepSeek V4.1-ধরনের ছোট সংস্করণ এলে পরিস্থিতি বদলাতে পারে। কিন্তু এই মুহূর্তে “আজ রাতে ইনস্টল করে, কাল থেকে কোড লেখানো”র জন্য Qwen3.8-27B-ই সবচেয়ে বাস্তবসম্মত।
※ এই নিবন্ধটি ২৫ সেপ্টেম্বর ২০২৬ পর্যন্ত প্রকাশিত তথ্য এবং এই সাইটের ৩–২৫ সেপ্টেম্বরের দৈনিক রিপোর্টের ভিত্তিতে তৈরি। মডেলের বেঞ্চমার্ক মানে অফিসিয়াল ঘোষণাও অন্তর্ভুক্ত; বাস্তব পরিবেশে গতি ও নির্ভুলতা কোয়ান্টাইজেশন পদ্ধতি, রানটাইম, কনটেক্সট দৈর্ঘ্য ও এজেন্ট কনফিগারেশনের ওপর নির্ভর করে বদলায়।



