ছবি ও ভিডিও জেনারেশন এআই সংবাদ — ২০২৬-০৯-১২
ওপেন-সোর্স শিবির—বিশেষ করে চীনা Z-Image, Qwen-Image ও MiniMax-H3—ব্লাইন্ড মূল্যায়নে ক্লোজড-সোর্স মডেলগুলোর খুব কাছাকাছি পৌঁছে গেছে। অন্যদিকে Google Nano Banana/Veo/Gemini Omni দিয়ে সর্বমুখী আক্রমণ চালাচ্ছে, আর OpenAI-এর Sora মূল্যতালিকা থেকে মডেল সরানো ও দায়িত্বপ্রাপ্ত ব্যক্তির বিদায়ের কারণে গতি হারানোর লক্ষণ দেখাচ্ছে।
ছবি ও ভিডিও জেনারেশন এআই সংবাদ সংকলন — ২০২৬-০৯-১২
হাই! এবার Reddit, X, YouTube, Bluesky, Lemmy ও Pinterest—এই ৬টি প্ল্যাটফর্ম জুড়ে ছবি ও ভিডিও জেনারেশন এআই নিয়ে গভীরভাবে খোঁজ করেছি🔥 সংক্ষেপে বললে, ক্লোজড-সোর্স দিকটায় Google ছবি ও ভিডিও—দুই ক্ষেত্রেই পূর্ণশক্তিতে এগোচ্ছে, আর OpenAI-এর Sora কিছুটা গতি হারাচ্ছে বলে মনে হচ্ছে😳। ওপেন-সোর্সে চীনা দলগুলো (Qwen, Z-Image, MiniMax, Wan) ব্লাইন্ড মূল্যায়নে সত্যিই খুব কাছাকাছি চলে এসেছে—পরিস্থিতি দারুণ উত্তেজনাপূর্ণ🔥🔥 তবে X-এর অনুসন্ধান পুরোপুরি ব্যর্থ হয়েছে: ছবি বা ভিডিও জেনারেশন এআই নিয়ে একটি পোস্টও মেলেনি। তাই এটিকে তথ্যের স্পষ্ট ঘাটতি হিসেবেই উল্লেখ করছি💦 আরও একটি চমক: সব প্ল্যাটফর্মেই “এটা কি এআই?” ধরনের সত্যতা ও বিশ্বাসযোগ্যতা-সংক্রান্ত আলোচনা খুব জোরালো ছিল, এবং তা মডেলের সক্ষমতা নিয়ে আলোচনার চেয়েও বেশি ছড়িয়েছে👀
সব প্ল্যাটফর্মে
- ওপেন-সোর্সের মূল চালিকাশক্তি এখন পুরোপুরি চীন🇨🇳: YouTube, Bluesky ও Lemmy—তিনটি প্ল্যাটফর্মেই স্বাধীনভাবে Qwen-Image, Z-Image (Turbo), MiniMax (H3/Hailuo 3.0) ও Alibaba Wan-কে “নতুন চ্যাম্পিয়ন” হিসেবে তুলে ধরা হয়েছে। Bluesky-এর ব্লাইন্ড লিডারবোর্ডে Qwen-Image-3.0-Pro, GPT Image 2(high)-এর থেকে মাত্র ৯২ Elo পয়েন্ট দূরে রয়েছে বলেও দাবি করা হয়েছে—এটি সত্যিই উল্লেখযোগ্য (https://bsky.app/profile/oludai.bsky.social/post/3mv5ywkauvt2t)।
- Google ছবি ও ভিডিও—দুই দিকেই সর্বাত্মকভাবে এগোচ্ছে: YouTube-এ Veo 3.1-এর রিভিউ (https://www.youtube.com/watch?v=sTOFXi2eY_k), Teacher's Tech-এর Nano Banana 2 পরিচিতি (https://www.youtube.com/watch?v=nikIxHM_AQY), আর Bluesky-এ “Gemini Omni” যুক্ত Windows ডেস্কটপ অ্যাপের খবর (https://bsky.app/profile/itmatterss.bsky.social/post/3mvayanva5c2n)—সব মিলিয়ে Google-এর আক্রমণাত্মক বিস্তার স্পষ্ট💪
- “এআই কিনা শনাক্ত করুন” ধরনের কনটেন্ট সত্যিই জনপ্রিয়: Reddit-এর r/isthisAI-তে যাচাইয়ের থ্রেড (https://www.reddit.com/r/isthisAI/comments/1wbspxo/) এবং Pinterest-এর ডিপফেক/এআই কণ্ঠ শনাক্তকরণ ইনফোগ্রাফিক—দুটিই আলাদাভাবে আলোচিত হয়েছে। সত্যতা নিয়ে উদ্বেগ একটি প্ল্যাটফর্ম-অতিক্রমী বিষয় হয়ে উঠেছে। মডেলের পারফরম্যান্স-সংবাদ থেকে এ ধরনের পোস্ট বেশি ছড়িয়েছে—এটি বেশ আশ্চর্যজনক।
- “আনলিমিটেড” ও “অ্যাফিলিয়েট” ধরনের প্রচারণামূলক দাবির প্রতি সর্বত্র সতর্কতা: Reddit-এর “'unlimited' দাবি করা সাইটগুলো প্রায়ই প্রতারণার কাছাকাছি” মন্তব্যটি (#4, r/generativeAI) এবং Bluesky-এ circuitai.bsky.social-এর WAN 3.0 নিয়ে একই লেখার স্প্যাম পোস্ট (প্রতিদিন ১৫ বারের বেশি)—একই প্রবণতা দেখায়। ব্যবহারকারীরা অতিরঞ্জিত বিপণন-দাবি নিয়ে যথেষ্ট সন্দিহান😤
- সাধারণ ব্যবহারকারীরা ওপেন ও ক্লোজড উৎসের তফাত খুব বেশি করেন না: Reddit-এর টুল-পরামর্শ থ্রেডে Qwen, Flux, Seedream, Veo ও GPT Image একই “ব্যবহারযোগ্য মডেলের তালিকা” হিসেবে পাশাপাশি এসেছে। উৎসভিত্তিক পার্থক্য নিয়ে মন্তব্য প্রায় ছিলই না। ব্রিফে চাওয়া দুই-মেরুর কাঠামো এবং ব্যবহারকারীর বাস্তব ধারণার মধ্যে যথেষ্ট ফারাক আছে।
প্ল্যাটফর্মভিত্তিক
Reddit — ১২টি থ্রেড সংগ্রহ করা হয়েছে (লক্ষ্যের প্রায় ২০টিতে পৌঁছানো যায়নি)। সবচেয়ে বেশি ছড়ানো পোস্টটি নতুন মডেল নিয়ে নয়; GPT-6-কে মাউস চালিয়ে ভুয়া হাতে-আঁকা টাইমল্যাপস বানাতে দেওয়ার বিষয় নিয়ে (r/antiai, ৭,১৪৬ পয়েন্ট, https://www.reddit.com/r/antiai/comments/1w81kdd/)—এআই-এর “প্রতারণা” নিয়ে ক্ষোভের পোস্ট। সেন্সরবিহীন ও NSFW-সমর্থিত একীভূত প্ল্যাটফর্ম (WildOwl.ai, cyberbara, Tensor.art ইত্যাদি)-এর উল্লেখ একাধিক থ্রেডে স্বাধীনভাবে এসেছে, যা চাহিদার ইঙ্গিত দেয়।
X — একেবারেই ফলহীন😭 সংগৃহীত ৪০টি পোস্ট মূলত Yemen পরিস্থিতি, $SONG মিমকয়েন এবং Chelsea FC নিয়ে ছিল; ছবি বা ভিডিও জেনারেশন এআই-সংক্রান্ত পোস্ট ছিল শূন্য। ব্যবহৃত অনুসন্ধানশব্দগুলো (ট্রেন্ডিং শব্দ) এ বিষয়ের সঙ্গে সামঞ্জস্যপূর্ণ ছিল না। পরেরবার Midjourney, Sora, Runway-এর মতো নির্দিষ্ট নাম দিয়ে আবার খোঁজা দরকার।
YouTube — এবার এখানেই তথ্য সবচেয়ে বেশি✨ ক্লোজড দিকটায় GPT Image 2/2.5 Artificial Analysis Image Arena-তে শীর্ষে (Elo ১,৩৩৯; ইতিহাসের সবচেয়ে বড় প্রথম ও দ্বিতীয় স্থানের ব্যবধান, https://www.youtube.com/watch?v=DY6TkI8XtkQ), Veo 3.1-এর উন্নত লিপ-সিঙ্ক, এবং ByteDance Seedream 5.0 Pro বিদ্যমান মডেলগুলোকে ছাড়িয়ে যাওয়ার দাবি (https://www.youtube.com/watch?v=WpcxwSNT3X4)। ওপেন দিকটায় Black Forest Labs FLUX.2-কে “নতুন চ্যাম্পিয়ন” কি না বলা হচ্ছে (https://www.youtube.com/watch?v=YQuTkPVkCS8), Alibaba Z-Image Turbo-কে স্থানীয় মডেলের KING বলা হয়েছে (https://www.youtube.com/watch?v=K0FgDU-9uik), আর Lightricks LTX-2-কে “ওপেন-সোর্স ভিডিওর হলি গ্রেইল” পর্যন্ত বলা হয়েছে।
Bluesky — Sora সম্ভবত সত্যিই গতি হারাচ্ছে👀 মূল্য পেজ থেকে sora-2 ও sora-2-pro নীরবে সরানো হয়েছে—এমন পোস্ট (https://bsky.app/profile/ctxwindow.kynth.studio/post/3muxriifygl23)-এর পাশাপাশি, সাবেক Sora প্রধান Bill Peebles হলিউডের প্রভাবশালী ব্যক্তিদের সঙ্গে স্বাধীন স্টার্টআপ চালু করছেন—এমন খবরও এসেছে (https://bsky.app/profile/theinformation.com/post/3mv6myz7pa52n)। ওপেন দিকটায় Qwen, Z-Image, MiniMax, WAN 3.0 ও SenseNova-U1.5—চীনা মডেলগুলো আলোচনায় আধিপত্য করছে।
Lemmy — প্ল্যাটফর্মটি ছোট, এবং কার্যত Even_Adder নামের একজনের কিউরেশনের ওপর নির্ভরশীল😅 কিন্তু ক্লোজড দিকের প্রধান খবরটি যথেষ্ট চমকপ্রদ: Midjourney নাকি ছবি জেনারেশন ছেড়ে “মেডিক্যাল স্পা ব্যবসা”য় (আল্ট্রাসাউন্ড CT স্ক্যান) মোড় নিয়েছে (https://www.theregister.com/ai-and-ml/2026/06/18/midjourney-pivots-from-ai-image-generation-to-body-scanning-medical-spa-where-patients-bathe-in-golden-light/5258429)। একে “Theranos-এর পুনরাবৃত্তি” বলে ব্যঙ্গ করা হয়েছে। ওপেন দিকটায় MiniMax-H3 ঘিরে ComfyUI টুল ও কোয়ান্টাইজেশন টুলের ইকোসিস্টেম বিস্ফোরিত হচ্ছে—এক সপ্তাহে ৭টির বেশি রিলিজ।
Pinterest — সব ৫০টি পিন চোখে দেখে যাচাই করা হয়েছে👀 ক্লোজড-সোর্স বাণিজ্যিক টুল (Runway, Pika, Kling AI, Luma, Canva, Hailuo, Synthesia) র্যাঙ্কিং-ভিত্তিক ইনফোগ্রাফিকে প্রায় প্রতিবারই এসেছে, কিন্তু ওপেন-সোর্স সম্পর্কিত পিন প্রায় দেখা যায়নি। Google Veo 2/3-এর অফিসিয়াল প্রচারসামগ্রী এবং ByteDance ও হলিউডের MPA-এর কপিরাইট চুক্তির মতো বাস্তব খবরও আছে, তবে বেশিরভাগই SEO/অ্যাফিলিয়েটনির্ভর ব্যাপক উৎপাদিত থাম্বনেইল। “YouTube-এর ২০%-এর বেশি এখন এআই-নির্মিত”—এমন নির্দিষ্ট সংখ্যার একটি পিনও ছিল (#44)।
কী নজরে রাখবেন
- Sora-এর গতি হারানো সত্যি কি না — Bluesky, মূল্য পেজ থেকে মডেল সরানোর পর্যবেক্ষণ (https://bsky.app/profile/ctxwindow.kynth.studio/post/3muxriifygl23)
- Qwen-Image-3.0-Pro, GPT Image 2-এর ব্যবধান কতটা কমাতে পারে — Bluesky, ব্লাইন্ড মূল্যায়ন লিডারবোর্ড (https://bsky.app/profile/oludai.bsky.social/post/3mv5ywkauvt2t)
- MiniMax-H3 ইকোসিস্টেমের বিস্তারের গতি — Lemmy, ComfyUI-সংলগ্ন টুলসমূহ (https://github.com/sepiablue-ai/ComfyUI-MiniMax-H3-W4A4-VSA)
- Midjourney-এর মেডিক্যাল স্পা ব্যবসা নিয়ে পরবর্তী খবর — Lemmy, TheRegister প্রতিবেদন (https://www.theregister.com/ai-and-ml/2026/06/18/midjourney-pivots-from-ai-image-generation-to-body-scanning-medical-spa-where-patients-bathe-in-golden-light/5258429)
- FLUX.2 / Z-Image Turbo-এর “লোকাল চ্যাম্পিয়ন” লড়াইয়ের ফল — YouTube(https://www.youtube.com/watch?v=YQuTkPVkCS8, https://www.youtube.com/watch?v=K0FgDU-9uik)
- সেন্সরবিহীন ও NSFW একীভূত প্ল্যাটফর্মগুলোর (WildOwl.ai ইত্যাদি) টিকে থাকার প্রবণতা — Reddit(https://www.reddit.com/r/AItips101/comments/1w9yftp/)
সুপারিশ
- পরেরবার X-এ ট্রেন্ডিং শব্দের বদলে Midjourney, Sora, Runway, Kling, Flux ও ComfyUI-এর মতো নির্দিষ্ট নাম দিয়ে অনুসন্ধান করা উচিত।
- Sora-এর গতিপথ যাচাই করতে Bluesky-র মূল্য পেজ পর্যবেক্ষণকারী অ্যাকাউন্টগুলো নিয়মিত অনুসরণ করা উচিত।
- ওপেন/ক্লোজড পারফরম্যান্স ব্যবধানের জন্য Qwen-Image-3.0Pro বনাম GPT Image 2-এর Elo স্কোরের পরিবর্তন পর্যবেক্ষণই সবচেয়ে সহজ সূচক।
- Midjourney-এর স্বাস্থ্যসেবা-ব্যবসায় মোড় নেওয়াকে প্রযুক্তিসংবাদ নয়, বরং ব্যবসায়িক কৌশলের খবর হিসেবে অনুসরণ করা মূল্যবান।
- Reddit সংগ্রহে পরেরবার ১২টির বদলে ২০টির লক্ষ্য পূরণে আরও অনুসন্ধানশব্দ যোগ করা উচিত।
- Pinterest-এর র্যাঙ্কিং ইনফোগ্রাফিক এবং Bluesky-এর অ্যাফিলিয়েট পোস্টকে একক উৎস হিসেবে বিশ্বাস না করে, অন্য প্ল্যাটফর্মে যাচাই মিললেই গ্রহণ করা উচিত।
তথ্যের মান
X-এ ভুল অনুসন্ধানশব্দ নির্বাচনের কারণে ছবি ও ভিডিও জেনারেশন এআই-সংক্রান্ত পোস্ট শূন্য ছিল; এই বিষয়ের জন্য কার্যত কোনো তথ্য নেই। Reddit ১২টি থ্রেডে থেমেছে, যা প্রায় ২০টির সমাপ্তি-মানদণ্ডে পৌঁছায়নি; বিষয়বস্তুটিও “সংবাদ”-এর চেয়ে “টুল সুপারিশ”ধর্মী। Pinterest-এর মূল ডেটায় ওপেন/ক্লোজড শ্রেণিবিভাগ ছিল না, তাই হাতে পুনর্বিভাগ দরকার হয়েছে। Lemmy ছোট পরিসরের প্ল্যাটফর্ম এবং কার্যত এক অ্যাকাউন্ট (Even_Adder)-এর কিউরেশনের ওপর নির্ভরশীল। YouTube ভিডিওপেজ JavaScript-রেন্ডার হওয়ায় WebFetch দিয়ে মূল লেখা পাওয়া যায়নি; oEmbed দিয়েও ভিউ বা সাবস্ক্রাইবার সংখ্যা মেলেনি। Bluesky-এ কিছু কীওয়ার্ডে (Runway, Kling, Black Forest Labs) ধারাবাহিক 403 ত্রুটি পাওয়ায় সংগ্রহ বন্ধ করতে হয়েছে; WAN 3.0-সম্পর্কিত ফলাফলও স্প্যাম অ্যাকাউন্টের পুনরাবৃত্ত পোস্টে ভরা ছিল।
প্ল্যাটফর্মভিত্তিক সারাংশ
Reddit — ছবি ও ভিডিও জেনারেশন এআই সংবাদ
কোথায়
সংগৃহীত ১২টি থ্রেড নিচের ৯টি সাবরেডিট থেকে এসেছে।
| সাবরেডিট | সদস্যসংখ্যা | সংগৃহীত থ্রেড |
|---|---|---|
| r/isthisAI | 408,823 | 1 |
| r/antiai | 322,973 | 1 |
| r/GetNoted | 298,488 | 1 |
| r/generativeAI | 152,415 | 3 |
| r/aiwars | 167,809 | 1 |
| r/hatethissmug | 134,660 | 1 |
| r/aivideomaking | 6,823 | 2 |
| r/GoogleFlow | 1,884 | 1 |
| r/AItips101 | 1,299 | 1 |
জেনারেটিভ এআই নিজেই গ্রহণযোগ্য কি না তা নিয়ে আলোচনা করা বড় সাবরেডিটগুলো (r/antiai, r/aiwars, r/isthisAI, r/GetNoted) থেকে উল্লেখযোগ্য অংশগ্রহণ দেখা গেছে। অপরদিকে টুল-পরিচিতি ও সুপারিশধর্মী মাঝারি আকারের সাবরেডিটগুলো (r/generativeAI, r/aivideomaking) বাস্তব টুল-প্রবণতা তুলে ধরেছে।
মানুষ কী বলছে
- 【#6, r/antiai, 7,146pt / 1,025 মন্তব্য, 2026-09-05】LLM-কে (GPT-6 হিসেবে উল্লেখিত) মাউস ও কীবোর্ড নিয়ন্ত্রণ দিয়ে ডিজিটাল ক্যানভাসে “হাতে আঁকতে” দেওয়া যায় এবং এমনকি ভুয়া টাইমল্যাপসও তৈরি করা যায়—এমন পোস্ট। শীর্ষ মন্তব্যে (2,511pt, u/Nayutantantan) ক্ষোভ প্রকাশ করা হয়েছে: এখন আর নিজের কাজের টাইমল্যাপস তুলতেও ইচ্ছা করে না, কারণ ভুয়া টাইমল্যাপস স্বাভাবিক হয়ে যাচ্ছে। এই একটি থ্রেডই সংগৃহীত সব কিছুর মধ্যে সবচেয়ে বড় প্রতিক্রিয়া পেয়েছে। https://www.reddit.com/r/antiai/comments/1w81kdd/
- 【#11, r/GetNoted, 4,470pt / 325 মন্তব্য, 2026-09-10】এআই-তৈরি ছবি ব্যবহার করা একটি X পোস্টে (সূচি-ছবিতে “Handloags”-এর মতো বিকৃত লেখা) হাস্যরসাত্মক সমালোচনা হয়। শীর্ষ মন্তব্যগুলো এআই-নির্মিত ছবির খসখসে ভুল নিয়ে মজা করেছে। https://www.reddit.com/r/GetNoted/comments/1wcw3n9/
- 【#1, r/AItips101, 145pt / 83 মন্তব্য, 2026-09-07】“২০২৬-এর সেন্সরবিহীন এআই ইমেজ জেনারেশন র্যাঙ্কিং।” এক নম্বরে WildOwl.ai—Qwen Image, Flux, Seedream, Wan, Kling, Seedance, Veo ও GPT Image-সহ ৩৫টির বেশি মডেলে ব্যবহারভিত্তিক অর্থপ্রদানে প্রবেশাধিকার, মাসিক ফি নেই এবং ক্রেডিটের মেয়াদ শেষ হয় না। u/reliablemicrophone84 (4pt) বলেছেন, অন্যত্র ফিল্টারে আটকে ক্রেডিট নষ্ট হওয়ায় এটি সহায়ক। অন্যদিকে u/Pretend_Program_3696 (3pt) Perchance/Uncensored.ai সুপারিশ করেছেন; মতভেদ রয়েছে। https://www.reddit.com/r/AItips101/comments/1w9yftp/
- 【#8, r/aivideomaking, 4pt / 21 মন্তব্য, 2026-09-09】“বিনামূল্যে/ক্রেডিটভিত্তিক ফটোরিয়াল ছবি ও ভিডিও জেনারেশন টুল” খোঁজার উত্তরে OpenartAI, fal, dzine, pixverse, Higgsfield ও RunningHub-এর নাম এসেছে; RunningHub দিয়ে ComfyUI-এর মাধ্যমে ওপেন ও ক্লোজড উভয় ধরনের মডেল ব্যবহার করা যায়। u/zeroludesigner বলেছেন, cyberbara-এর Seedance 2.5 সেন্সরবিহীন এবং বাস্তব মুখ সমর্থন করে। https://www.reddit.com/r/aivideomaking/comments/1wbxpdf/
- 【#3, r/generativeAI, 0pt / 7 মন্তব্য, 2026-09-11】ব্রাউজারেই চলা, NSFW-সমর্থিত ছবি/ভিডিও টুলের খোঁজে থ্রেড। u/MisterZan25 RunDiffusion/Tensor.art (ছবি ও চরিত্র-সামঞ্জস্য), PornGen/PornJourney এবং Pika Labs-মিরর ধরনের টুল (ভিডিও) গুছিয়ে উপস্থাপন করেন। u/frighten (1pt) শুধু iPhone-এর জন্য “PixelForge” অ্যাপটিকে ডিভাইসেই চলা ও সেন্সরবিহীন হিসেবে সুপারিশ করেছেন। https://www.reddit.com/r/generativeAI/comments/1wdkbxv/
- 【#4, r/generativeAI, 1pt / 11 মন্তব্য, 2026-09-07】“সবচেয়ে সস্তা আনলিমিটেড 1080p ছবি-থেকে-ভিডিও পরিষেবা কোনটি?”—এর উত্তরে Artlist.io (€550/বছর) সম্ভাব্য বিকল্প। তবে একাধিক মন্তব্য “আনলিমিটেড” দাবির সমালোচনা করেছে: u/ai_art_is_art (3pt) বলেছেন, “'unlimited' বলা সাইটগুলো সাধারণত প্রতারণার কাছাকাছি; $550 দিলেও $200-এর কাজ করে ২৪ ঘণ্টা অপেক্ষা করায়।” https://www.reddit.com/r/generativeAI/comments/1wa4k88/
- 【#5, r/aivideomaking, 16pt / 38 মন্তব্য, 2026-09-07】“শুধু ফোন/iPad ব্যবহার করে বিনামূল্যে ৪৫ সেকেন্ডের ভিডিও বানাতে চাই”—এমন প্রশ্নে u/NewLifeWares (2pt) বাস্তবসম্মত উত্তর দেন: ৪৫ সেকেন্ড কার্যত ডেটাসেন্টার-পর্যায়ের চাহিদা; বিনামূল্যে সর্বোচ্চ জলছাপযুক্ত ৫ সেকেন্ডের ১–২টি ক্লিপ পাওয়া যেতে পারে, যেগুলো জুড়ে নিতে হবে। u/GuessingEngineer (2pt) ব্যঙ্গ করে বলেন, এক ধাপে এটি করা গেলে “আপনি পৃথিবীর শাসক হয়ে যেতেন।” বিনামূল্যে, উচ্চমানের এবং দীর্ঘ ভিডিও—এই তিনটির একসঙ্গে চাহিদা ও তার অবাস্তবতা স্পষ্ট হয়েছে। https://www.reddit.com/r/aivideomaking/comments/1w9h5a9/
- 【#7, r/GoogleFlow, 6pt / 2 মন্তব্য, 2026-09-10】Google Flow (Veo)-র জন্য ব্যাচ জেনারেশন Chrome এক্সটেনশন “AutoFlow” প্রকাশিত হয়েছে। এতে ব্যাচ জেনারেশন, আগের ক্লিপের শেষ ফ্রেম থেকে ধারাবাহিক ক্লিপ তৈরি এবং অডিও/সাবটাইটেলসহ বর্ণনামূলক ভিডিও স্বয়ংক্রিয় সম্পাদনার সুবিধা রয়েছে; বিনামূল্যের সংস্করণের সঙ্গে Pro/Ultra সাবস্ক্রিপশন মডেল আছে। https://www.reddit.com/r/GoogleFlow/comments/1wccmrg/
- 【#12, r/aiwars, 0pt / 14 মন্তব্য, 2026-09-08】এআই-তৈরি কোনো ব্যক্তি কাকতালীয়ভাবে বাস্তব কারও মতো দেখতে হলে প্রতিকৃতি-অধিকার ও বিজ্ঞাপনী ব্যবহারের ঝুঁকি নিয়ে আলোচনা। u/Upstairs-Mammoth-509 (3pt) বলেছেন, অখ্যাত সাধারণ মানুষের মুখের সঙ্গে হঠাৎ মিলে যাওয়ার ঘটনাই সবচেয়ে কঠিন; কোম্পানিগুলো উল্টো ইমেজ সার্চ করে পরীক্ষা করে এবং আশা করা ছাড়া বিশেষ কিছু করতে পারে না—যা আইনি কাঠামোর পিছিয়ে পড়া দেখায়। https://www.reddit.com/r/aiwars/comments/1wafe86/
- 【#10, r/hatethissmug, 59pt / 20 মন্তব্য, 2026-09-12】“জেনারেটিভ এআই সমালোচনা করেও ব্যবহার করা ভিডিও” নিয়ে এআই-বিরোধী গোষ্ঠীর মধ্যকার মতপার্থক্য। u/AprilsStuff (22pt) বলেছেন, তিনি এআই-বিরোধী হলেও পরিবেশগত ক্ষতি নিয়ে বিতর্ক অতিরঞ্জিত, এবং “এআই আপনাআপনি হারিয়ে যাবে”—এমন ধারণাও বাস্তবসম্মত নয়। অর্থাৎ এআই-বিরোধী অবস্থানের মধ্যেও ভিন্নমত আছে। https://www.reddit.com/r/hatethissmug/comments/1wdxv6k/
- 【#2, r/isthisAI, 0pt / 31 মন্তব্য, 2026-09-09】একটি ভিডিও এআই-নির্মিত নাকি বাস্তব—তা নিয়ে যাচাই থ্রেড। নেকলেসের উধাও হয়ে আবার দেখা যাওয়া (u/smalltiddygothb, 16pt / u/EmergencyWaffleBox, 14pt)-কে মূল প্রমাণ ধরা হয়েছে। u/BouncingSphinx (5pt) বলেছেন, ভিডিওটি ঠিক ১৫ সেকেন্ড হওয়াও বর্তমান এআই ভিডিওর সীমার মতো। সাধারণ ব্যবহারকারীর মধ্যে দৈর্ঘ্য ও অসামঞ্জস্যের মতো প্রযুক্তিগত সীমাবদ্ধতা এআই ভিডিও চেনার মানদণ্ড হয়ে উঠছে। https://www.reddit.com/r/isthisAI/comments/1wbspxo/
সংকেত
- যা বাড়ছে: সেন্সরবিহীন ও NSFW-সমর্থিত একীভূত প্ল্যাটফর্ম (WildOwl.ai, cyberbara, RunDiffusion, Tensor.art, PixelForge ইত্যাদি) একাধিক থ্রেডে স্বতন্ত্রভাবে এসেছে। “সর্বশেষ মডেলে প্রবেশাধিকার” ও “শিথিল সেন্সরশিপ”—দুই চাহিদাই শক্তিশালী।
- যা বাড়ছে: Google Flow-এর জন্য #7-এর AutoFlow-এর মতো তৃতীয় পক্ষের স্বয়ংক্রিয়তা টুল—অর্থাৎ অফিসিয়াল টুলকে সম্পূরক করা ইকোসিস্টেম।
- যা অপছন্দ করা হচ্ছে: “আনলিমিটেড” দাবি করা সাবস্ক্রিপশন (#4, Artlist.io ইত্যাদি) কমিউনিটি নিয়মিত সন্দেহের চোখে দেখে।
- যা অপছন্দ করা হচ্ছে: এআই-বিরোধী পক্ষের ভেতরেও পরিবেশগত ক্ষতির যুক্তি জোর দেওয়ার প্রবণতা (#10) নিয়ে “অতিরঞ্জন” বলার প্রতিক্রিয়া রয়েছে; এআই-বিরোধী বক্তব্য একমুখী নয়।
- অপ্রত্যাশিত বিষয়: সংগৃহীত ১২টি থ্রেডের মধ্যে সর্বোচ্চ এনগেজমেন্ট পেয়েছে নতুন মডেলের রিলিজ নয়, “এআই দিয়ে হাতে আঁকার ভান করে টাইমল্যাপস জাল করা” নিয়ে এআই-বিরোধী অভিযোগ (#6, 7,146pt) ও এআই-তৈরি ছবিজনিত আলোড়ন (#11, 4,470pt)। Reddit-এ পণ্যের সংবাদের চেয়ে এআই-এর প্রতারণা ও বিশ্বাসযোগ্যতার আলোচনাই অনেক বেশি ছড়ায়।
- অপ্রত্যাশিত বিষয়: ক্লোজড/ওপেন-সোর্স বিভাজন ব্যবহারকারীর আগ্রহের কেন্দ্রে নয়। অধিকাংশ থ্রেডে Qwen, Flux, Seedream, Wan, Kling, Seedance, Veo ও GPT Image-কে একই ব্যবহারযোগ্য মডেল-তালিকায় বলা হয়েছে; উৎসভিত্তিক পার্থক্য নিয়ে মন্তব্য খুব কম।
সীমাবদ্ধতা
- অনুসন্ধানশব্দ ছিল শুধু "Image and Video Generation AI News"; এতে ১২টি থ্রেড পাওয়া গেছে, যা সমাপ্তির আনুমানিক ২০টির লক্ষ্য পূরণ করেনি।
- সংগ্রহটি ওয়ার্কার দ্বারা আগে চালানো হেডলেস ব্রাউজিংয়ের ফল পড়ার আকারে করা হয়েছিল; Reddit WebFetch বা অনুসন্ধানের পৃষ্ঠা প্রত্যাখ্যান করায় এবার অতিরিক্ত অনুসন্ধান ও দেখা সম্ভব হয়নি।
- অধিকাংশ সংগৃহীত পোস্ট ছিল “ভালো টুল বলুন” ধরনের প্রশ্নোত্তর; তাই এটি সংবাদ নয়, বরং কমিউনিটির বাস্তব টুল-ব্যবহারের চিত্রের কাছাকাছি। ক্লোজড ও ওপেন উৎসের গতিবিধি স্পষ্টভাবে আলোচনা করা বিশেষজ্ঞ সংবাদ-থ্রেড পাওয়া যায়নি।
- r/AItips101 (১,২৯৯ সদস্য) ও r/GoogleFlow (১,৮৮৪ সদস্য) খুব ছোট সাবরেডিট; সেখানকার তথ্য পুরো কমিউনিটির প্রতিনিধিত্ব না করে ব্যক্তিগত কণ্ঠস্বর হিসেবে দেখা উচিত।
X
X — ছবি ও ভিডিও জেনারেশন এআই সংবাদের প্রবণতা
অ্যাকাউন্ট
এবার সংগৃহীত ৪০টি পোস্ট ৪০টি আলাদা অ্যাকাউন্ট থেকে, প্রতিটি অ্যাকাউন্টের মাত্র একটি পোস্ট করে এসেছে; একই অ্যাকাউন্টের পুনরাবৃত্তি নেই। এদের কেউই ছবি বা ভিডিও জেনারেশন এআই (Midjourney, Stable Diffusion, Sora, Runway, Kling, Veo, ComfyUI, Flux ইত্যাদি) নিয়ে বিশেষায়িত অ্যাকাউন্ট নয়। অনুসন্ধানশব্দ অনুসারে ক্লাস্টারগুলো আলাদা।
- Yemen/Saudi (মধ্যপ্রাচ্যের পরিস্থিতি ও OSINT): @tleilax___, @Ahmed175143, @IranTimes72, @citrinowicz, @Osinttechnical, @c14english, @Rusia_HD, @MerruX — সৌদি তেল অবকাঠামোতে হামলা ও ইয়েমেন সংঘাত নিয়ে OSINT/সংবাদ অ্যাকাউন্ট।
- $SONG (Cardano-সংশ্লিষ্ট মিমকয়েন): @LagyADA, @EAjdarovic, @JureKaramarko, @SintoAndrej — ছোট আকারের জল্পনা ও প্রচারমূলক অ্যাকাউন্ট।
- Charlie Kirk (প্রথম মৃত্যুবার্ষিকী প্রসঙ্গ): @tivent_1, @TruthNetwork24, @mscaradapawjob, @rokkstarrrrrrr — রাজনৈতিক মন্তব্য ও মিম প্রতিক্রিয়া।
- Britain (যুক্তরাজ্যের রাজনীতি): @brigantia__, @Steven41849941, @SirJBritain, @BROKENBRITAIN0 — অভিবাসন ও নিরাপত্তা নিয়ে জাতীয়তাবাদী ধরনের পোস্ট।
- Anthropic (এআই অর্থনীতি ও নিরাপত্তা-আলোচনা): @restitutorII, @BrianRoemmele, @walterkirn, @claudecode84 — Anthropic-এর অর্থনৈতিক দৃশ্যপট পূর্বাভাস, Claude Code ওপেন-সোর্স এবং এআই সমালোচনা। ছবি/ভিডিও জেনারেশন নয়; LLM এজেন্ট ও এআই-সমাজ নিয়ে আলোচনা।
- Apple/Samsung (স্মার্টফোন বিতর্ক): @FlossyCarter, @cagriozturkish, @appleinteligen, @BrandonKHill — ফোল্ডেবল ফোন নিয়ে ভক্তদের তর্ক।
- Sony (গেমিং শিল্প): @JayDubcity16, @Cris_Uther, @treeblazah, @ScreenCraveHQ — Hideo Kojima ও Spider-Man চলচ্চিত্র নিয়ে গসিপ।
- "one ai os" (এআই স্টার্টআপের আত্মপ্রচার): @de1lymoon, @neda_sefati, @harvey_control, @Iamanusbutt — এআই এজেন্ট/ব্যবসায়িক OS-ভিত্তিক স্টার্টআপ নেটওয়ার্কিং পোস্ট; ছবি বা ভিডিও জেনারেশনের উল্লেখ নেই।
- Chelsea (ফুটবল): @declanstar1, @TheHateCentra, @Lea_EFC, @chelcatastr0phe — Chelsea FC ম্যাচ নিয়ে পোস্ট।
এক পোস্টে বড় ভাইরাল হওয়া ব্যক্তি ও বারবার ছোট পোস্ট করা ব্যক্তির পার্থক্য বলার মতো পুনরাবৃত্ত পোস্টার নেই। @rokkstarrrrrrr (9,404 লাইক), @TheHateCentra (19,654 লাইক) ও @Cris_Uther (17,095 লাইক) একক পোস্টে সবচেয়ে বেশি পৌঁছেছে, তবে সবই বিষয়বহির্ভূত।
পোস্ট
ছবি বা ভিডিও জেনারেশন এআই-কে সরাসরি উল্লেখ করা পোস্ট শূন্য। বিষয়টির সবচেয়ে কাছাকাছি, যদিও তবু অপ্রাসঙ্গিক, কয়েকটি পোস্ট নিচে দেওয়া হলো।
-
#21 @restitutorII — 458 likes・69 reposts・41 replies・~57,000 views・2026-09-10
https://x.com/restitutorII/status/2097918742571139093"Anthropic in its report imagines 3 possible futures for the American economy in 2030 based on the power and adoption of AI..."
→ Anthropic-এর অর্থনৈতিক দৃশ্যপট পূর্বাভাস। এটি সামগ্রিক জেনারেটিভ এআই নিয়ে, ছবি বা ভিডিও জেনারেশন এআইয়ের প্রবণতা নয়। -
#24 @claudecode84 — 2,585 likes・268 reposts・24 replies・~741,000 views・2026-09-10
https://x.com/claudecode84/status/2097959830942367747"Anthropic最高責任者本人が自分の『Claude Code環境』を丸ごとオープンソース化しています"
→ Claude Code-এর পরিবেশ সম্পূর্ণ ওপেন-সোর্স করার বিষয়। ছবি বা ভিডিও জেনারেশন মডেলের সঙ্গে সম্পর্কিত নয়। -
#33 @de1lymoon — 49 likes・6 reposts・9 replies・~3,500 views・2026-09-11
https://x.com/de1lymoon/status/2098428267158032841"Grok Bot + Kimi K3 is where an AI agent starts turning into an operating system..."
→ এআই এজেন্ট অর্কেস্ট্রেশন নিয়ে আলোচনা; ছবি বা ভিডিও জেনারেশনের সঙ্গে সম্পর্কহীন। -
#22 @BrianRoemmele — 792 likes・187 reposts・105 replies・~100,000 views・2026-09-10
https://x.com/BrianRoemmele/status/2098024115231924568
→ Anthropic সমালোচনা ও এআই-হুমকি নিয়ে মিমধর্মী পোস্ট; ছবি বা ভিডিও জেনারেশনের উল্লেখ নেই। -
#23 @walterkirn — 723 likes・91 reposts・39 replies・~28,000 views・2026-09-10
https://x.com/walterkirn/status/2098059171325427949
→ একইভাবে Anthropic/মিডিয়া সমালোচনার প্রসঙ্গ; ছবি বা ভিডিও জেনারেশনের উল্লেখ নেই।
উপরের পাঁচটিই “AI” কীওয়ার্ডে পাওয়া প্রাসঙ্গিকতার সবচেয়ে কাছাকাছি ফল; ক্লোজড বা ওপেন, কোনো ধরনের ছবি/ভিডিও জেনারেশন এআই সংবাদ হিসেবে গ্রহণযোগ্য নয়।
সংকেত
- X Explore-এ (এই সেশনে যুক্ত সার্ভারের অঞ্চল সম্ভবত ক্রোয়েশিয়া; পোস্টে “Trending in Croatia” লেখা ছিল) শীর্ষ ১০ ট্রেন্ড ছিল “Yemen”, “Saudi”, “$SONG”, “Charlie Kirk”, “Britain”, “Anthropic”, “Apple”, “Sony”, “one ai os”, “Chelsea”; Midjourney, Sora, Stable Diffusion, Runway, Kling বা Veo-এর মতো ছবি/ভিডিও জেনারেশন এআই শব্দ একটিও ছিল না।
- “Anthropic” ও “one ai os” ট্রেন্ডে থাকায় বোঝা যায় X-এ এআই এজেন্ট ও LLM-এর অর্থনৈতিক প্রভাব নিয়ে আলোচনা সক্রিয়, কিন্তু তা এই প্রতিবেদনের বিষয়—ছবি ও ভিডিও জেনারেশন এআই—থেকে পৃথক।
- সংগৃহীত ৪০টি পোস্টে ছবি/ভিডিও জেনারেশন টুলের নাম, রিলিজ, ডেমো ভিডিও বা তুলনা নিয়ে একটি পোস্টও নেই।
সীমাবদ্ধতা
- ব্যবহৃত অনুসন্ধানশব্দ—"Yemen", "Saudi", "$SONG", "Charlie Kirk", "Britain", "Anthropic", "Apple", "Sony", "one ai os", "Chelsea"—সবই X Explore-এর দিনের ট্রেন্ডিং শব্দ ছিল; ছবি ও ভিডিও জেনারেশন এআইয়ের শব্দ (যেমন Midjourney, Stable Diffusion, Sora, Runway, Kling, Veo, ComfyUI, Flux) ছিল না। ফলে ৪০টি পোস্টে ক্লোজড বা ওপেন—কোনো ধরনের ছবি/ভিডিও জেনারেশন এআই সংবাদ অন্তর্ভুক্ত হয়নি।
- তাই এই ধাপে ব্রিফে চাওয়া “ওপেন-সোর্স ১০টি ও ক্লোজড-সোর্স ১০টি অন্তর্দৃষ্টি” X-এর ডেটা থেকে তৈরি সম্ভব নয়। সঠিকভাবে বললে, X “কিছু বলেনি” এমন নয়; বরং বিষয়সংশ্লিষ্ট অনুসন্ধানই করা হয়নি।
- পরেরবার Midjourney, Stability AI, Runway, Pika, Luma, Kling, Sora, Google Veo, Flux ও ComfyUI-এর মতো টুল ও প্রতিষ্ঠানের নাম দিয়ে পুনঃসংগ্রহ করা দরকার।
YouTube
YouTube — ছবি ও ভিডিও জেনারেশন এআই সংবাদ (ক্লোজড/ওপেন-সোর্স)
চ্যানেল
- There's An AI For That — এআই টুল পরিচিতিমূলক চ্যানেল; FLUX.2-এর রিভিউ প্রকাশ করেছে।
- AI Search — নতুন মডেলের দ্রুত সংবাদভিত্তিক চ্যানেল; Sora 2 ও HunyuanVideo 1.5 নিয়ে ভিডিও।
- Theoretically Media — এআই ভিডিও জেনারেশনে বিশেষায়িত চ্যানেল; Veo 3.1-এর বিস্তারিত রিভিউ।
- Teacher's Tech — ব্যবহারিক টুলভিত্তিক চ্যানেল; Nano Banana 2-এর রিভিউ।
- Codebreakers — ওপেন-সোর্স এআই মডেলের রিভিউ ও ব্যাখ্যামূলক চ্যানেল; MiniMax H3 নিয়ে বিশেষ পর্ব।
- Bijan Bowen — লোকাল এআই ইমেজ জেনারেশনে বিশেষজ্ঞ চ্যানেল; Z-Image Turbo পরীক্ষা করেছে।
- Benji's AI Playground — ComfyUI/লোকাল জেনারেশন টিউটোরিয়াল চ্যানেল; Ideogram 4.0 ব্যাখ্যা।
- Curious Refuge — এআই চলচ্চিত্র-নির্মাণ শিক্ষার প্রতিষ্ঠিত চ্যানেল; Midjourney V8 রিভিউ।
- RandomAI — নতুন মডেলের সংবাদ ও তুলনাভিত্তিক চ্যানেল; GPT Image 2.5 ব্যাখ্যা।
- Standarity / The AI Filmmaking Advantage — দ্রুত সংবাদ ও তুলনামূলক পরীক্ষা চ্যানেল; Seedream 5.0 Pro ঘোষণা ও পূর্ণ পরীক্ষা।
- MattVidPro AI — Runway Gen-4-সম্পর্কিত প্রথম প্রতিক্রিয়ার ভিডিওতে উল্লেখ করেছে।
ভিডিও
- “Is FLUX 2.0 The New Open Source King?” — There's An AI For That — https://www.youtube.com/watch?v=YQuTkPVkCS8 — Black Forest Labs-এর FLUX.2 কি ওপেন-সোর্স ছবি জেনারেশনের নতুন চ্যাম্পিয়ন হতে পারে, তা পরীক্ষা।
- “We have a new #1 open-source AI video generator!”(2025-11-25)— AI Search — https://www.youtube.com/watch?v=6EQP8-D37bs — ComfyUI-তে HunyuanVideo 1.5-এর রিভিউ ও ইনস্টল নির্দেশনা; কম VRAM-এও চলে বলে পরিচিতি।
- “Sora 2… wtf” — AI Search — https://www.youtube.com/watch?v=El-G4cO4x4I — OpenAI Sora 2-কে Veo 3, Kling 2.5 ও Hailuo 02-এর সঙ্গে তুলনা; অডিও সিঙ্ক ও পদার্থবিজ্ঞানের প্রকাশ উন্নত হয়েছে বলে উল্লেখ।
- “Veo 3.1 Is More Powerful Than You Realize!”(2025-10-16)— Theoretically Media — https://www.youtube.com/watch?v=sTOFXi2eY_k — Google Veo 3.1-এর লিপ-সিঙ্ক, চরিত্রের সামঞ্জস্য ও 1080p আপস্কেলিং উন্নতি ব্যাখ্যা।
- “The New Gemini Image Generator is Insane (Nano Banana 2)”— Teacher's Tech — https://www.youtube.com/watch?v=nikIxHM_AQY — Gemini অ্যাপের ডিফল্ট মডেল Nano Banana 2-এ বদলানোর খবর।
- “MiniMax H3: The New Open-Source Video Champ?”(2026-08-03)— Codebreakers — https://www.youtube.com/watch?v=3R5GROj8Tcg — ওপেন-ওয়েট অমনিমোডাল ভিডিও মডেল MiniMax H3 (Hailuo 3.0) এক পাসেই নেটিভ স্টেরিও অডিওসহ ভিডিও তৈরি করতে পারে বলে পরিচিতি।
- “Alibaba Z-Image Turbo Test – The New KING of LOCAL Image Models”— Bijan Bowen — https://www.youtube.com/watch?v=K0FgDU-9uik — Apache-2.0 লাইসেন্সের Z-Image Turbo স্থানীয়ভাবে পরীক্ষা করে KING হিসেবে আখ্যায়িত।
- “Ideogram 4.0 Released! The New Open Model That FINALLY Gets Text Right”(2026-06-04)— Benji's AI Playground — https://www.youtube.com/watch?v=HY_e5CZfJfQ — Ideogram-এর প্রথম ওপেন-ওয়েট মডেল Design Arena-তে প্রথম হয়েছে এবং লেখার উপস্থাপনা শেষ পর্যন্ত নির্ভুল হয়েছে—এমন প্রতিবেদন।
- “I Tried Midjourney 8… Here's the Truth”(2026-03-19)— Curious Refuge — https://www.youtube.com/watch?v=i9qV9-2tzEA — Midjourney V8-এর সক্ষমতা পরীক্ষা ও সরাসরি মূল্যায়ন।
- “GPT Image 2.5 Is AMAZING: Full Breakdown of OpenAI's New Image Model”— RandomAI — https://www.youtube.com/watch?v=DY6TkI8XtkQ — OpenAI-এর GPT Image 2/2.5, উন্নত টেক্সট রেন্ডারিং ও বহুভাষা সমর্থন ব্যাখ্যা।
- “ByteDance Seedream 5.0 Pro: The Announcement, Read and Highlighted”— Standarity — https://www.youtube.com/watch?v=g05iPef37Qs — স্তরভিত্তিক সম্পাদনাযোগ্য Seedream 5.0 Pro-এর ঘোষণার সারাংশ।
- “🚨BREAKING: Seedream 5.0 Pro Just SMOKED Every Image Model (Fully Tested)”(2026-07-16)— The AI Filmmaking Advantage — https://www.youtube.com/watch?v=WpcxwSNT3X4 — Seedream 5.0 Pro-কে অন্যান্য মডেলের সঙ্গে পূর্ণ পরীক্ষায় তুলনা করে বিদ্যমান মডেলগুলোকে ছাড়িয়ে গেছে বলে মূল্যায়ন।
সংকেত
ক্লোজড-সোর্স দিকের অগ্রগতি
- OpenAI GPT Image 2 / 2.5 Artificial Analysis Image Arena-তে শীর্ষে; Elo স্কোর ১,৩৩৯, এবং “Arena-এর ইতিহাসে প্রথম ও দ্বিতীয়ের বৃহত্তম ব্যবধান” বলে প্রতিবেদন রয়েছে (২০২৬ সালের সেপ্টেম্বর পর্যন্ত)।
- Google Veo 3.1 ও Nano Banana Pro (Gemini 3 Pro Image) ভিডিও ও ছবির দুই ক্ষেত্রেই শক্তিশালী হয়েছে; লিপ-সিঙ্ক, 1080p আপস্কেলিং ও লেয়ার সম্পাদনার মতো পেশাদার ব্যবহারকেন্দ্রিক বৈশিষ্ট্য স্পষ্ট।
- ByteDance Seedance 2.0 (২০২৬-০২) ও Seedream 5.0 Pro (২০২৬ সালের জুলাইয়ের কাছাকাছি) টেক্সট+ছবি+ভিডিও+অডিও রেফারেন্সের বহুমাত্রিকতা দিয়ে দ্রুত উপস্থিতি বাড়াচ্ছে।
- xAI Grok Imagine 1.5 Veo ও Sora-কে বেঞ্চমার্কে ছাড়িয়ে যায়—এমন দাবি করা ভিডিও একাধিক পোস্টে আলোচিত হয়েছে (২০২৬ সালের জুনের আশেপাশে)।
- Runway Gen-4/4.5, Midjourney V8 সিরিজ (V8.1, V8.2)-এর মতো প্রতিষ্ঠিত খেলোয়াড়রাও নিয়মিত আপডেট দিচ্ছে; “সিংহাসন রক্ষা” ধরনের রিভিউ ভিডিও অনেক।
ওপেন-সোর্স দিকের অগ্রগতি
- Black Forest Labs FLUX.2-কে স্থানীয়ভাবে চালানো যায় এমন উচ্চমানের ছবি মডেল এবং “নতুন চ্যাম্পিয়ন” হিসেবে একাধিক রিভিউতে আখ্যায়িত করা হয়েছে।
- Tencent HunyuanVideo 1.5 ComfyUI-তে নেটিভ সমর্থন পেয়েছে এবং কম VRAM পরিবেশেও চলে; ওপেন-সোর্স ভিডিও জেনারেশনের নতুন মানদণ্ড হিসেবে দেখা হচ্ছে।
- Alibaba/Tongyi-MAI-এর Z-Image ও Z-Image Turbo Apache-2.0-তে প্রকাশিত হয়েছে এবং বহু চ্যানেলে “লোকাল মডেলের নতুন চ্যাম্পিয়ন” বলা হয়েছে।
- Ideogram 4.0 কোম্পানিটির প্রথম ওপেন-ওয়েট মডেল হিসেবে প্রকাশিত; Design Arena-তে প্রথম হয়েছে এবং লেখার রেন্ডারিংয়ের নির্ভুলতা জোর দিয়ে বলা হয়েছে।
- MiniMax H3 (Hailuo 3.0) RTX 3090-এর মতো ব্যক্তিগত GPU-তেও চলতে পারে এমন ওপেন-ওয়েট অমনিমোডাল ভিডিও মডেল হিসেবে ২০২৬ সালের আগস্টে দ্রুত আলোচনায় আসে; ComfyUI সমর্থনের ভিডিওও দ্রুত বেড়েছে।
- Lightricks LTX-2 ওপেন-সোর্সে 4K, 50fps এবং অডিও-সিঙ্কড ভিডিও জেনারেশন সম্ভব করেছে; একে “ওপেন-সোর্স ভিডিওর হলি গ্রেইল” বলা হয়েছে।
- Alibaba Wan 2.5/2.6 সিরিজও টেক্সট, ছবি, অডিও ও ভিডিও ইনপুট সমর্থনকারী ওপেন-সোর্স ভিডিও মডেল হিসেবে নিয়মিত আলোচিত।
সীমাবদ্ধতা
- YouTube অনুসন্ধান ফলের পৃষ্ঠা (
youtube.com/results?...) JavaScript-রেন্ডার হওয়ায় WebFetch-এ শিরোনাম, ভিউ বা চ্যানেল-তথ্যের বদলে শুধু ফুটার ফিরেছে। পৃথক ভিডিও পেজেও একই সমস্যা থাকায় শিরোনাম ও চ্যানেল নিশ্চিত করতে YouTube oEmbed API (youtube.com/oembed) ব্যবহার করা হয়েছে। - oEmbed API ভিউ, প্রকাশের তারিখ, সাবস্ক্রাইবার বা মন্তব্য ফেরত দেয় না; ফলে এ প্রতিবেদনে ভিউ ও সাবস্ক্রাইবার সংখ্যা পাওয়া যায়নি। কিছু WebSearch স্নিপেটে পাওয়া প্রকাশের তারিখই কেবল দেওয়া হয়েছে; অন্যগুলো বাদ।
- “LTX-2: Open Source AI Video, Released to the Community” (zSvCnVi181A) oEmbed অ্যাক্সেসে 403 Forbidden ফিরিয়েছে; যাচাই করা যায়নি।
- উপরোক্ত কারণে ভিডিওগুলোর মন্তব্য বিভাগ দেখা যায়নি; সারাংশ শুধু শিরোনাম ও বর্ণনার ভিত্তিতে।
- প্রবণতা শক্তিশালী করতে WebSearch-এর তথ্য (নিবন্ধের স্নিপেট ও সংশ্লিষ্ট ব্লগ) মিলিয়ে ব্যবহার করা হয়েছে, তবে যুক্ত সব ভিডিও যে বাস্তব YouTube URL তা নিশ্চিত করা হয়েছে।
Bluesky
Bluesky — ছবি ও ভিডিও জেনারেশন এআই সংবাদ (ক্লোজড/ওপেন-সোর্স)
অ্যাকাউন্ট
- theinformation.com / techmeme.com / mediagazer.com / lefiltech.fr — RSS-সংযুক্ত সংবাদ বট; OpenAI ও Sora-সংক্রান্ত স্কুপ বহু ভাষায় ছড়ায়।
- ctxwindow.kynth.studio(#TechBluesky) — OpenAI-এর মূল্য পেজের পরিবর্তন নিয়মিত পর্যবেক্ষণ করে পোস্ট করা ওয়াচার।
- gen-ai.news — Midjourney আপডেটের দ্রুত সংবাদ দেওয়া ব্যক্তিগত নিউজ অ্যাকাউন্ট।
- oludai.bsky.social — নিজস্ব ব্লাইন্ড মানব-মূল্যায়ন লিডারবোর্ড (olud.ai) চালায় এবং ওপেন/ক্লোজড ছবি মডেলকে প্রতি ঘণ্টায় র্যাঙ্ক করে।
- aichina.news — Huawei Modelers.cn-এ প্রকাশিত Apache-2.0 FLUX-ভিত্তিক LoRA নিয়ে প্রায় প্রতিদিন জানানো বটসদৃশ অ্যাকাউন্ট।
- circuitai.bsky.social — Alibaba WAN 3.0-এর অ্যাফিলিয়েট লিংক (vidhapi.app) প্রায় একই লেখায় প্রতিদিন বহুবার পোস্ট করা স্প্যাম/প্রচারমূলক অ্যাকাউন্ট।
- arxiv-cs-cv.bsky.social — ছবি ও ভিডিও জেনারেশন ক্ষেত্রে নতুন arXiv গবেষণাপত্র স্বয়ংক্রিয়ভাবে পোস্ট করে।
- un1v3rse.bsky.social / carlbetheav.bsky.social / stumblegirl.bsky.social / ttaships.airminded.org — Midjourney দিয়ে প্রতিদিন কাজ প্রকাশ করা ব্যক্তিগত শিল্পী (#midjourney #QP #FoxyFriday)।
- rin-yamami.bsky.social / satomin6.alimika.jp — Qwen-Image-Edit ও ComfyUI ব্যবহারকারী জাপানি ভাষাভাষী এআই ইলাস্ট্রেটর।
পোস্ট
- theinformation.com(2026-09-10, 👍1 🔁0)— সাবেক OpenAI Sora প্রধান Bill Peebles, হলিউডের প্রভাবশালী Jeffrey Katzenberg (সাবেক DreamWorks) ও সাবেক Dropbox CFO-এর সঙ্গে নিজস্ব ভিডিও জেনারেশন এআই স্টার্টআপ শুরু করছেন—এমন স্কুপ।
https://bsky.app/profile/theinformation.com/post/3mv6myz7pa52n - ctxwindow.kynth.studio(2026-09-08, 👍0/1 🔁0)— OpenAI মূল্য পেজ থেকে sora-2 ও sora-2-pro নীরবে সরিয়ে দিয়েছে (পুরোনো মূল্য: 720p $0.05〜$0.30); Sora সংকোচনের একটি ইঙ্গিত।
https://bsky.app/profile/ctxwindow.kynth.studio/post/3muxriifygl23 - somewhattolerable.com(2026-09-06, 👍2)— “অভ্যন্তরীণ প্রকৌশলীরা এটিকে অতিরিক্ত রিসোর্সখেকো বলায় OpenAI Sora বন্ধ করেছে”—এমন পর্যবেক্ষণ।
https://bsky.app/profile/somewhattolerable.com/post/3muuuazkaf223 - itmatterss.bsky.social(2026-09-11, 👍1)— Google Gemini Windows ডেস্কটপ অ্যাপ হয়েছে (Alt+Space দিয়ে চালু)। ছবি জেনারেশনে Nano Banana এবং ভিডিওতে “Gemini Omni” যুক্ত বলে উল্লেখ।
https://bsky.app/profile/itmatterss.bsky.social/post/3mvayanva5c2n - dimnews.bsky.social(2026-09-11, রুশ ভাষায়)— SenseTime ৮ বিলিয়ন প্যারামিটারের মাল্টিমোডাল “SenseNova-U1.5” প্রকাশ করেছে এবং দৃশ্যগত যুক্তিতে Nano-Banana-Pro-কে ছাড়িয়ে যায় বলে দাবি করেছে।
https://bsky.app/profile/dimnews.bsky.social/post/3mv7u7crnzz25 - gen-ai.news(2026-08-30, 👍1)— Midjourney V8.2-এর সম্পাদনা মডেল গুণগত অবনতি নিয়ে অভিযোগের পর নীরবে প্যাচ করা হয়েছে বলে প্রতিবেদন।
https://bsky.app/profile/gen-ai.news/post/3mudbgowbnz2s - futureautomationai.bsky.social(2026-09-03, 👍2)— “Midjourney in 2026” সারাংশ: V8.2, পার্সোনালাইজেশন, মুডবোর্ড, সম্পাদনা মডেল ও রেফারেন্স ফিচার।
https://bsky.app/profile/futureautomationai.bsky.social/post/3mumtnbxuv22d - oludai.bsky.social(2026-09-10/11, 👍1-2)— ব্লাইন্ড মূল্যায়ন লিডারবোর্ডে “ডাউনলোডযোগ্য সেরা মডেল” Qwen-Image-3.0-Pro (#12), যা GPT Image 2 (high)-এর মাত্র ৯২ Elo পয়েন্ট পেছনে।
https://bsky.app/profile/oludai.bsky.social/post/3mv5ywkauvt2t - ddigitalmedia.bsky.social(2026-09-10, 👍1)— “Qwen, Z-Image ও MiniMax-ই পশ্চিমা LLM/ইমেজ পণ্যের মোকাবিলায় একমাত্র সক্ষম” বলে মূল্যায়ন।
https://bsky.app/profile/ddigitalmedia.bsky.social/post/3mv6lyejx3223 - circuitai.bsky.social(2026-09-11〜12, পুনরাবৃত্ত পোস্ট)— Alibaba ভিডিও মডেল “WAN 3.0”-কে ByteDance Seedance 2.5-এর কম দামের, ব্যবহারভিত্তিক প্রতিদ্বন্দ্বী হিসেবে প্রচার; প্রতি ক্লিপ সর্বোচ্চ ৩০ সেকেন্ড। ※ একই অ্যাফিলিয়েট লেখা প্রতিদিন ১৫ বারেরও বেশি পোস্ট করা হয়েছে।
https://bsky.app/profile/circuitai.bsky.social/post/3mvbvqsdvr22p - minaxlab.bsky.social(2026-09-11)— ComfyUI v0.35.1 প্রকাশের ঘোষণা; ওপেন-সোর্স লোকাল জেনারেশন পরিবেশ নিয়মিত আপডেট হচ্ছে।
https://bsky.app/profile/minaxlab.bsky.social/post/3mvasr3l72x2i - aichina.news(2026-09-08〜09, ধারাবাহিক পোস্ট)— Huawei Modelers.cn-এ Apache-2.0 লাইসেন্সের FLUX-ভিত্তিক LoRA একের পর এক প্রকাশিত হচ্ছে, কিন্তু অনেকটিতে ট্রিগার শব্দ বা বেঞ্চমার্ক নেই; তাই “Qwen-Image-কে ছাড়িয়ে গেছে” বলার প্রমাণ অপর্যাপ্ত—এমন পুনরাবৃত্ত মূল্যায়ন।
https://bsky.app/profile/aichina.news/post/3mv3vq3zdui24 - arxiv-cs-cv.bsky.social(2026-09-11)— ভিডিও মডেলের “Think-with-Video” যুক্তি করার সক্ষমতা মূল্যায়ন ও উন্নতির নতুন গবেষণাপত্র প্রকাশিত (From Evaluation to Enhancement)।
https://bsky.app/profile/arxiv-cs-cv.bsky.social/post/3mvbfk6tunc2j
সংকেত
- Sora কার্যত গতি হারাচ্ছে: মূল্য পেজ থেকে মডেল সরানো, সাবেক প্রধানের বিদায় ও প্রতিদ্বন্দ্বী স্টার্টআপ প্রতিষ্ঠা, এবং অতিরিক্ত রিসোর্স ব্যবহারের কারণে বন্ধ করার পর্যবেক্ষণ—সব একই সময়ে এসেছে। OpenAI-এর ভিডিও জেনারেশন এখন প্রতিরক্ষামূলক মনে হচ্ছে।
- Google উল্টো সর্বাত্মক বিস্তারে: Nano Banana (ছবি), Nano Banana Pro, Veo ও Gemini Omni (ভিডিও)—সব Windows অ্যাপ পর্যন্ত একীভূত করে সবখানে জেনারেটিভ এআই বসানোর কৌশল।
- ওপেন-সোর্সের কেন্দ্রে চীনা দলগুলো: Qwen-Image-3.0-Pro, Z-Image (Turbo), MiniMax, Alibaba WAN 3.0 ও SenseTime SenseNova-U1.5 আলোচনার কেন্দ্রে। “পশ্চিমা ছবি/ভিডিও এআই পণ্যের প্রতিদ্বন্দ্বিতা করতে পারে কেবল চীনা ওপেন মডেল”—এমন বক্তব্য একাধিক অ্যাকাউন্টে এসেছে।
- ক্লোজড উৎসের সঙ্গে ব্যবধান কমছে: ব্লাইন্ড মূল্যায়নে Qwen-Image-3.0-Pro, GPT Image 2 (high)-এর ৯২ Elo পয়েন্টের মধ্যে এসেছে (oludai.bsky.social-এর নিয়মিত পরিমাপ)।
- শব্দদূষণ ও প্রচারণার দিকে সতর্কতা: WAN 3.0-সংক্রান্ত অধিকাংশ পোস্ট circuitai.bsky.social-এর একই অ্যাফিলিয়েট লেখার পুনরাবৃত্তি; তাই এটি স্বতঃস্ফূর্ত আলোচনার প্রমাণ নয়।
- টুলের ক্ষেত্রে ComfyUI ও LoRA ইকোসিস্টেমের ক্রমাগত উন্নতি: ComfyUI মূল সফটওয়্যার আপডেটের পাশাপাশি Huawei Ascend NPU-এর জন্য FLUX LoRA পোর্টের মতো CUDA-বহির্ভূত হার্ডওয়্যারে স্থানান্তরও এগোচ্ছে।
সীমাবদ্ধতা
- Bluesky পাবলিক API (
public.api.bsky.appওapi.bsky.app-এরapp.bsky.feed.searchPosts) মাঝে মাঝে 403 ত্রুটি দিয়েছে, যা রেট-লিমিটিং বলে মনে হয়। একটানা কুয়েরিতে ব্যর্থতা বেশি; বিরতি দিয়ে পুনঃচেষ্টা করলে বেশিরভাগ সফল হয়েছে। Runway Gen,Kling AI,Black Forest Labs,Wan 2.5-এর মতো কিছু কীওয়ার্ডে ধারাবাহিক 403 পাওয়ায় অনুসন্ধান ছেড়ে দিতে হয়েছে; বিকল্প কুয়েরি (Wan videoইত্যাদি) ব্যবহার করা হয়েছে। Runway ও Kling-এর সরাসরি পোস্ট এখানে সংগ্রহ করা যায়নি।bsky.app/searchওয়েব UI JavaScript SPA; ফেচ করলে মূল লেখা রেন্ডার হয়নি, ফলে পুরোপুরি পাবলিক API JSON-এর ওপর নির্ভর করতে হয়েছে।- “Flux” বা “Z-Image” শব্দের আক্ষরিক অনুসন্ধানে Aeon Flux, সৌর ফ্লাক্স, Pokémon Z-A, প্রাপ্তবয়স্ক ভিডিও সাইট ইত্যাদি বিপুল অপ্রাসঙ্গিক ফল এসেছে; বাদ দিতে সময় লেগেছে।
- The Information-এর Katzenberg-সংক্রান্ত খবর ও arXiv গবেষণাপত্র শুধু শিরোনাম ও সারাংশ পর্যায়ে যাচাই করা হয়েছে; সম্পূর্ণ লেখা যাচাই করা হয়নি (পেওয়াল ও বিশেষজ্ঞ গবেষণাপত্র হওয়ায়)।
Lemmy
Lemmy — ছবি ও ভিডিও জেনারেশন এআই সংবাদ
কমিউনিটি
- !«メールアドレス» — মোট 5,709 সাবস্ক্রাইবার (এর মধ্যে স্থানীয় 893)। এই বিষয়ে Lemmy-এর সবচেয়ে বড় হাব; ছবি ও ভিডিও জেনারেশন এআই টুল/মডেলের রিলিজ তথ্য এখানে জমা হয়। সাম্প্রতিক পোস্টগুলোর প্রায় সবই
Even_Adderনামের একজন ব্যবহারকারীর, যিনি প্রায় প্রতিদিন নতুন GitHub/HuggingFace রিলিজ পোস্ট করেন। - !«メールアドレス» / lemmy.world — জেনারেটেড ছবির কাজ ভাগাভাগির কমিউনিটি; সংবাদের চেয়ে গ্যালারি বেশি (স্কোর -14 থেকে 16 পর্যন্ত)।
- !«メールアドレス» — SDXL ও কাস্টম LoRA দিয়ে বিমূর্ত শিল্প তৈরির বিশেষায়িত কমিউনিটি; শুধু সেপ্টেম্বরে ১০টির বেশি পোস্ট, সক্রিয়তা বেশি।
- !ai_reddit@[বিভিন্ন ইনস্ট্যান্স] — Reddit r/ArtificialInteligence-এর ক্রসপোস্ট জমার কমিউনিটি; মৌলিক আলোচনা কম।
- !«メールアドレス» — সাধারণ প্রযুক্তি সংবাদ; Midjourney-সম্পর্কিত একটি নিবন্ধ 70pt-এর বেশি পেয়েছে।
- !hackernews@[বিভিন্ন ইনস্ট্যান্স] — Hacker News ক্রসপোস্ট; Midjourney-এর বিতর্ক একাধিকবার এসেছে।
- !techtakes@[বিভিন্ন ইনস্ট্যান্স] — এআই-সমালোচনামুখর কমিউনিটি; “Midjourney pivots to Theranos” 40pt পেয়েছে।
- !llm@[বিভিন্ন ইনস্ট্যান্স] — LLM-নির্ভর কমিউনিটি; GPT-6 Astra প্রকাশের পোস্ট আছে, কিন্তু -3 স্কোরে প্রতিক্রিয়া ঠান্ডা।
- !«メールアドレス» — Perchance টেক্সট/ইমেজ জেনারেশন টুল নিয়ে ছোট কমিউনিটি।
ইনস্ট্যান্সভেদে API 404 ফেরত দেওয়ায় !«メールアドレス» ছাড়া অন্য কমিউনিটির সাবস্ক্রাইবার সংখ্যা নির্ভুলভাবে যাচাই করা যায়নি।
পোস্ট
ক্লোজড-সোর্সের দিকে ঝোঁকা
- "Midjourney pivots from AI image generation to body scanning medical spa" — !«メールアドレス», 58pt, 2026-06-18. https://www.theregister.com/ai-and-ml/2026/06/18/midjourney-pivots-from-ai-image-generation-to-body-scanning-medical-spa-where-patients-bathe-in-golden-light/5258429 — Midjourney ছবি জেনারেশন থেকে আল্ট্রাসাউন্ড CT-নির্ভর মেডিক্যাল স্পা (Midjourney Medical) ব্যবসায় মোড় নিয়েছে—এমন চমকপ্রদ খবর।
- "Midjourney AI pivots to Theranos: Ultrasonic CT" — !techtakes, 40pt, 2026-06-19. https://pivot-to-ai.com/2026/06/19/midjourney-ai-pivots-to-theranos-ultrasonic-ct/ — উপরোক্ত ঘটনাকে “Theranos-এর পুনরাবৃত্তি” বলে ব্যঙ্গ করা মন্তব্য।
- "Midjourney Medical" অফিসিয়াল পৃষ্ঠা — !hackernews, 3pt, 2026-06-18. https://www.midjourney.com/medical
- "Midjourney wants Hollywood studios to reveal the details of their AI usage" — !«メールアドレス», 73pt, 2026-07-05. https://techcrunch.com/2026/07/04/midjourney-wants-hollywood-studios-to-reveal-the-details-of-their-ai-usage/ — Midjourney হলিউড স্টুডিওগুলোর কাছে এআই ব্যবহারের বিস্তারিত প্রকাশের দাবি করেছে।
- "Behind the scenes with the Midjourney scanner"(ভিডিও)— !hackernews, 1pt, 2026-07-06. https://www.youtube.com/watch?v=4nzzpUKhj1M
- "Amnesty International's May 2026 briefing calls leading generative AI systems 'unlawful by design'" — !ai_reddit, 1pt, 2026-06-24. https://www.reddit.com/r/ArtificialInteligence/comments/1ue64s2/ — মানবাধিকার সংস্থাটি বড় ক্লোজড-সোর্স জেনারেটিভ এআই ব্যবস্থার (ছবি জেনারেশনসহ) প্রশিক্ষণ ডেটা সংগ্রহকে আইনবিরোধী বলে সমালোচনা করেছে।
- GPT-6 Astra প্রকাশ — !llm, -3pt, 2026-09-04. https://openai.com/index/gpt-6-astra/ — LLM নিজে সরাসরি ছবি/ভিডিও তৈরি করে না; Responses API-এর মাধ্যমে টুল কল করে। কমিউনিটির প্রতিক্রিয়া সীমিত এবং স্কোর নেতিবাচক।
ওপেন-সোর্সের দিকে ঝোঁকা (সবগুলো !«メールアドレス»-এ, পোস্টকারী Even_Adder)
- MiniMax-H3 ভিডিও জেনারেশন মডেলের আশপাশের টুলসমূহ — 9/4〜9/10-এর মধ্যে ৭টির বেশি (
ComfyUI-MiniMax-H3-W4A4-VSA,MiniMax-H3-Semantic-Bridge,ComfyUI-Ref2VA-VSA,Minimax-h3_Singularity,minimax-h3_fl2v_8Step_motion_enhancer,ComfyUI-VDN-H3,vdn-minimax-h3,FastH3-Ref2V-Stream-Controller)। কোয়ান্টাইজেশন, গতি বৃদ্ধি ও সেমান্টিক ব্রিজসহ ওপেন-সোর্স ভিডিও মডেল MiniMax-H3-এর ইকোসিস্টেম দ্রুত বিস্তৃত হচ্ছে। উদাহরণ: https://github.com/sepiablue-ai/ComfyUI-MiniMax-H3-W4A4-VSA - "LLaDA-Image: Building Strong Image Generators" — 3pt, 2026-09-04. https://arxiv.org/abs/2609.03796 — 6B প্যারামিটারের ওপেন-সোর্স Diffusion Transformer গবেষণাপত্র।
- Krea 2 Turbo-এর জন্য দুটি LoRA —
F16/krea2-turbo-sda(2pt, 9/10, https://huggingface.co/F16/krea2-turbo-sda)এবংlvladikov/Krea2-Turbo-Distill-4step-LoRA(2pt, 9/8, ৪ ধাপের ডিস্টিলেশনে 45% মানোন্নতির দাবি)। - "Viggle/Viggle-Animate" — 10pt, 2026-09-05. https://huggingface.co/Viggle/Viggle-Animate — একটি পুনরায় আঁকা ফ্রেম থেকে ভিডিওর চরিত্র প্রতিস্থাপনের প্রযুক্তি।
- "How a 20-year-old independent builder from Bihar created an open omni AI model" — !ai_reddit, 0pt, 2026-09-11. https://www.reddit.com/gallery/1wdii5s — 5.84B প্যারামিটারের একটি ওপেন অমনি মডেল বেঞ্চমার্কে (MATH-500) Apple-এর AFM 3B মডেলকে ছাড়িয়ে গেছে—এমন খবর।
সংকেত
- ওপেন-সোর্সে মডেলের চেয়ে আশপাশের ইকোসিস্টেমই প্রধান প্রতিযোগিতাক্ষেত্র। বিশেষত MiniMax-H3 ভিডিও মডেলকে কেন্দ্র করে কোয়ান্টাইজেশন, গতি বৃদ্ধি, ComfyUI নোড ও LoRA—এক সপ্তাহে ১০টির বেশি রিলিজ হয়েছে; কমিউনিটির আগ্রহ এখানেই কেন্দ্রীভূত।
- Lemmy-তে এই বিষয়ের প্রচার কার্যত একজন ব্যক্তির (Even_Adder) কিউরেশনের ওপর নির্ভরশীল। আলোচনামূলক থ্রেডের চেয়ে এটি লিংক-তালিকার মতো, এবং মন্তব্য প্রায় শূন্য।
- ক্লোজড দিকের বড় বিষয় নতুন মডেল প্রতিযোগিতা নয়; Midjourney-এর মেডিক্যাল স্পা ব্যবসায় মোড় নেওয়া। এটি প্রযুক্তিসংবাদের চেয়ে কোম্পানি-সমালোচনা ও ব্যঙ্গের বেশি (pivot-to-ai-এর মতো সমালোচনামূলক মাধ্যম সামনে এসেছে)।
- Amnesty International-এর প্রতিবেদনের মতো মানবাধিকার গোষ্ঠীর সমালোচনাও ক্লোজড-সোর্স জেনারেটিভ এআইয়ের বৈধতা ও ডেটা সংগ্রহের প্রশ্ন তুলেছে।
- GPT-6 Astra (২০২৬ সালের সেপ্টেম্বর) সরাসরি ছবি/ভিডিও তৈরি করে না; ফলে এ বিষয়টিতে তার সরাসরি গুরুত্ব কম এবং Lemmy-তে প্রতিক্রিয়াও নেতিবাচক।
সীমাবদ্ধতা
- Lemmy অনুসন্ধান API কীওয়ার্ড মেলানোর ওপর নির্ভরশীল;
Sora,Veo,Runway,Kling,Grok Imagine,Nano Bananaদিয়ে খুঁজেও প্রাসঙ্গিক ফল মেলেনি। এসব বিষয় Lemmy-তে প্রায় আলোচিত হয় না। !«メールアドレス»(অন্য ইনস্ট্যান্স) HTTP 503-এর কারণে পড়া যায়নি; dbzer0 সংস্করণ বিকল্প হিসেবে নেওয়া হয়েছে।- একাধিক কমিউনিটির সাবস্ক্রাইবার API (
/api/v3/community?name=...) 404 ফেরত দিয়েছে; ফলে তাদের নির্ভুল সদস্যসংখ্যা যাচাই করা যায়নি। - মোট ২০টি পোস্ট বিষয়ের সঙ্গে সম্পর্কিত হিসেবে সংগৃহীত হলেও Lemmy এই বিষয়ে খুব ছোট প্ল্যাটফর্ম; প্রকৃত উৎস কয়েকটি কমিউনিটি ও অ্যাকাউন্টে কেন্দ্রীভূত। মৌলিক আলোচনা অপ্রতুল এবং অধিকাংশই লিংক পোস্ট বা রিপোস্ট।
Pinterest — ছবি ও ভিডিও জেনারেশন এআই সংবাদ
output/pinterest.pins.md-এ থাকা ৫০টি পিন (কোনো শ্রেণিবিভাগ নেই; একক কুয়েরি "Image and Video Generation AI News" দিয়ে সংগৃহীত) প্রতিটিই ছবি খুলে যাচাই করা হয়েছে।
দৃশ্যগত থিম
- নিয়ন নীল/বেগুনি ভবিষ্যতমুখী UI পটভূমি সবচেয়ে বেশি দেখা যায়। কালো পটভূমিতে সার্কিট প্যাটার্ন, উজ্জ্বল এআই লোগো ও হোলোগ্রামধর্মী মানবসদৃশ অবয়ব—ইনফোগ্রাফিক ও ভিডিও থাম্বনেইল উভয় ক্ষেত্রেই সাধারণ
[1, 3, 4, 5, 34, 37, 39, 41, 48]। - দাড়িওয়ালা পুরুষ YouTuber-এর মুখের ক্লোজ-আপ + বড় “AI NEWS” লেখা + প্রতিষ্ঠানের লোগোর কোলাজ ধরনের নির্দিষ্ট থাম্বনেইল বারবার দেখা যায়। বিস্মিত বা সন্দেহপ্রবণ মুখ দিয়ে নজর কেড়ে Google/OpenAI/Microsoft/Meta/Anthropic লোগো সাজানোর কাঠামো পুনরাবৃত্ত
[4, 20, 21, 45]। - “best AI video tool” র্যাঙ্কিং ইনফোগ্রাফিক প্রচুর; প্রায় একই টেমপ্লেট—নম্বর দেওয়া কার্ড, লোগো, বৈশিষ্ট্যের চেকলিস্ট ও “best for”—বারবার ব্যবহৃত। Runway, Pika, Kling AI, Luma (Dream Machine), Canva, Hailuo ও Synthesia প্রায় সব তালিকায় স্থায়ী নাম
[7, 8, 13, 24, 40]। - “বাস্তব বনাম এআই” শনাক্ত করতে বলা ফরম্যাট চোখে পড়ার মতো। ল্যান্ডস্কেপ ছবির দুইপাশের তুলনা-ধাঁধা, ডিপফেক ট্রেন্ড ব্যাখ্যা এবং এআই কণ্ঠ শনাক্তকরণ মিটার—সত্যতা নিয়ে উদ্বেগভিত্তিক একাধিক পিন
[16, 17, 20, 37]। - মানবাকৃতির রোবটকে “এআই”-এর প্রতীক হিসেবে বারবার ব্যবহার করা হয়েছে। সংবাদ উপস্থাপকের মতো রোবট, পৃথিবীর দিকে ইঙ্গিত করা রোবট, অর্ধেক সাইবর্গ মুখের কোলাজ—প্রকৃত প্রযুক্তিগত বিষয়ের সঙ্গে সম্পর্ক ছাড়াই সাধারণ আকর্ষণীয় ভিজ্যুয়াল
[2, 34, 37, 39, 48]। - উপাদান রূপান্তরের ডেমো গ্রিড একটি পিনে রয়েছে—একই ব্যক্তি, কুকুর ও গাড়ির ভিডিওকে “কাঠের ব্লক”, “অরিগামি”, “লেগো”, “ফুল”-এ রূপান্তরিত করে পাশাপাশি দেখানো হয়েছে; ভিডিও মডেলের সৃজনক্ষমতার একটি নির্দিষ্ট ডেমো
[6]। - ফ্রিল্যান্স/কনট্রাক্ট কাজের প্রচার পিনও মিশে আছে। “এআই ভিডিও বানিয়ে দেব” ধরনের Fiverr-সদৃশ বিজ্ঞাপন, WhatsApp যোগাযোগসহ পোস্ট বা Jeff Bezos-এর জেনারেটেড ছবি ব্যবহার করা Fiverr অফার একাধিক
[15, 32, 42]। - বাস্তব পণ্য-সংবাদ (অফিসিয়াল ঘোষণার স্ক্রিনশট) মোটের একটি অংশ মাত্র; অধিকাংশই SEO/অ্যাফিলিয়েটনির্ভর ব্যাপক উৎপাদিত ইনফোগ্রাফিক বা YouTube থাম্বনেইল। প্রকৃত সংবাদের মধ্যে Google Veo 2/3, Microsoft VASA-1, ShengShu Vidu S1, Adobe আপস্কেলিং মডেল, AMD Amuse 3.0 ও ByteDance-MPA কপিরাইট চুক্তি আছে
[3, 5, 12, 29, 46, 10, 47, 31]।
উল্লেখযোগ্য পিন
- #3/#5 — Google announces ultra-high quality video / Veo 2 promo — Google-এর অফিসিয়াল প্রচারসামগ্রী; কুকুরের পানির নিচে সাঁতার, ফ্লেমিঙ্গো ও রান্নাঘরে মেয়ের অ্যানিমেশনসহ প্রকৃত Veo 2 আউটপুটের উদাহরণ।
- #12 — Veo 3 Image-to-Video: Fast Generation & Native Audio via Gemini API — Gemini API দিয়ে Veo 3 ছবি-থেকে-ভিডিও এবং নেটিভ অডিও—এই নির্দিষ্ট ফিচার আপডেট।
- #6 — উপাদান রূপান্তর ডেমো গ্রিড (Luma-ধরনের) — একই উৎস ভিডিওকে কাঠের ব্লক/অরিগামি/লেগো/ফুলে রূপান্তরের তুলনামূলক গ্রিড; মডেলের ক্ষমতা সবচেয়ে স্পষ্টভাবে দেখানো একটি ছবি।
- #16 — "Why Is Trump Obama AI Video Trending?" — ভাইরাল এআই ভিডিও ট্রেন্ড নিয়ে বিস্তারিত ইনফোগ্রাফিক। ব্যবহৃত টুল হিসেবে Runway ML, Pika Labs, Kaiber, HeyGen, CapCut AI ও DeepBrain AI উল্লেখ করেছে।
- #29 — ShengShu Technology unveils Vidu S1 — “রিয়েল-টাইম, ইন্টার্যাকটিভ জেনারেশন”কে সামনে রেখে চীনা মডেল ঘোষণার পিন।
- #31 — ByteDance and Hollywood reach global deal on AI copyright — ByteDance ও MPA (Motion Picture Association) এআই ছবি ও ভিডিও জেনারেশন টুলের কপিরাইট সুরক্ষায় সমঝোতায় পৌঁছেছে—এমন আইন ও IP-সংক্রান্ত বাস্তব সংবাদ।
- #44 — "More than 20% of YouTube is now AI-generated" — নির্দিষ্ট পরিসংখ্যান দেওয়া বিরল পিনগুলোর একটি।
- #46 — Microsoft VASA-1 — এক ছবি ও অডিও ক্লিপ থেকে কথা বলা ভিডিও তৈরি করার গবেষণা-ডেমো।
- #47 — "Amuse 3.0" (AMD) — এআই ছবি তৈরির টুলের নতুন সংস্করণ ঘোষণার পিন।
- #37 — এআই কণ্ঠ শনাক্তকরণ ইনফোগ্রাফিক ("97% likely AI generated") — সত্যতা যাচাই ও এআই নীতিশাস্ত্রভিত্তিক সচেতনতা পিন।
সংকেত
- আলোচনার কেন্দ্র এখনো ক্লোজড-সোর্স বাণিজ্যিক টুল (Runway, Pika, Kling AI, Luma, Canva, Hailuo, Synthesia, D-ID); র্যাঙ্কিং ইনফোগ্রাফিকে এদের লোগো প্রায় প্রতিবারই আছে। Stable Video Diffusion, ComfyUI ওয়ার্কফ্লো বা Open-Sora-এর মতো ওপেন-সোর্স/স্ব-হোস্টেড সরঞ্জামকে সামনে আনা পিন মেলেনি।
- Google Veo 2/3 সবচেয়ে চোখে পড়া অফিসিয়াল পণ্য-সংবাদ; Gemini API দিয়ে ছবি-থেকে-ভিডিও ও নেটিভ অডিওর ফিচারগুলো জোর দেওয়া হয়েছে।
- চীনা মডেলগুলোর মধ্যে ShengShu-এর Vidu S1 “রিয়েল-টাইম, ইন্টার্যাকটিভ জেনারেশন” হিসেবে এসেছে।
- ডিপফেক ও সত্যতা নিয়ে উদ্বেগ—Trump-Obama ভিডিও ট্রেন্ড, এআই কণ্ঠ শনাক্তকরণ, “কোনটি এআই?” ধাঁধা—Pinterest-এ ধারাবাহিক উপবিষয়।
- YouTube-এ এআই-তৈরি কনটেন্টের অংশ (২০%-এর বেশি) এবং ByteDance-MPA কপিরাইট চুক্তির মতো শিল্পকাঠামো ও আইনগত সংবাদও কিছু রয়েছে।
- তবে মডেল আর্কিটেকচার, প্রশিক্ষণপদ্ধতি বা বেঞ্চমার্ক তুলনার মতো প্রযুক্তিগত গভীরতা প্রায় নেই; Pinterest-এর স্বভাব অনুযায়ী বিষয়বস্তু “টুল পরিচিতি”, “হাউ-টু” ও ভাইরাল ঘটনার ব্যাখ্যায় ঝুঁকে আছে।
সীমাবদ্ধতা
- ওয়ার্কারের সংগ্রহ কুয়েরি ছিল একটিই (
"Image and Video Generation AI News"), এবং ওপেন/ক্লোজড উৎসের মতো শ্রেণিবিভাগ করা ছিল না; ফলে এই বিশ্লেষণও বিভাগভিত্তিক নয়, ৫০টি পিন মিলিয়ে করা হয়েছে। বিভাগভিত্তিক বিভাজন পরবর্তী সমন্বিত ধাপে রাখা হয়েছে। - কিছু পিন এ বিষয়ের সঙ্গে কম সম্পর্কিত বা সাধারণ স্টক ছবি ছিল (যেমন
#35বিশ্বমানচিত্রের সাম্প্রতিক বিষয়ের ছবি,#43চেলো বাজানো ভাস্কর্যের মতো ছবি,#22Adobe Stock আইকন)। Pinterest-এর অনুসন্ধান মিল ঢিলা হওয়ায় এ ধরনের শব্দদূষণ মিশেছে। - Pinterest পিনে প্রকাশের তারিখ দেখা যায় না; তাই প্রতিটি পিন কখনের তা নির্ধারণ করা যায়নি—শিরোনামের “2025”, “2026” ইত্যাদিই একমাত্র ইঙ্গিত।
- পিনের শিরোনাম Pinterest-এ ক্যাশ করা লেখা; লিংক করা নিবন্ধের প্রকৃত তারিখ বা বিবরণ ভিন্ন হতে পারে। এই অংশে কেবল ছবি ও শিরোনামের সীমার মধ্যেই যাচাই করা হয়েছে।
সুপারিশকৃত পদক্ষেপ
- X-এর অনুসন্ধান ট্রেন্ডিং শব্দে নয়, বরং Midjourney, Sora, Runway, Kling, Flux ও ComfyUI-এর মতো নির্দিষ্ট নামে পুনরায় করা উচিত।
- Qwen-Image-3.0-Pro বনাম GPT Image 2-এর Elo ব্যবধান নিয়মিত পর্যবেক্ষণ করে ওপেন/ক্লোজড পারফরম্যান্স ব্যবধান অনুসরণ করা উচিত।
- Sora-এর গতি হারানোর ধারণা যাচাই করতে Bluesky-এর মূল্য পেজ পর্যবেক্ষণকারী অ্যাকাউন্ট নিয়মিত অনুসরণ করা উচিত।
- Reddit-এ প্রায় ২০টি সংগ্রহের লক্ষ্য পূরণে অনুসন্ধানশব্দ বাড়ানো উচিত।
- Pinterest-এর র্যাঙ্কিং ইনফোগ্রাফিক বা Bluesky-এর অ্যাফিলিয়েট পোস্ট অন্য প্ল্যাটফর্মে যাচাই না হওয়া পর্যন্ত একক উৎস হিসেবে বিশ্বাস করা উচিত নয়।
সংগৃহীত ছবি


















































তথ্যমান নোট
X-এ ভুল অনুসন্ধানশব্দের কারণে ছবি ও ভিডিও জেনারেশন এআই-সংক্রান্ত পোস্ট শূন্য ছিল। Reddit ১২টিতেই শেষ হয়েছে, যা প্রায় ২০টির সমাপ্তি-মানদণ্ডে পৌঁছায়নি। YouTube-এ JavaScript রেন্ডারিং সীমাবদ্ধতার কারণে ভিউ ও সাবস্ক্রাইবার সংখ্যা পাওয়া যায়নি, আর Bluesky-এ কিছু কীওয়ার্ডে ধারাবাহিক 403 ত্রুটি হওয়ায় সংগ্রহ বন্ধ করা হয়েছে।



