
ডিজনি এবং ইউনিভার্সাল পিকচার্সের কাছ থেকে কপিরাইট মামলার সম্মুখীন হয়েও, অভিজ্ঞ গ্রাফিক ডিজাইন "ইউনিকর্ন" মিডজার্নি তার গতি কমিয়ে দেয়নি। পরিবর্তে, এটি চাপের মধ্যে আজ সকালে তার প্রথম ভিডিও মডেল চালু করেছে।
রঙের মিল সুনির্দিষ্ট, রচনাটি সূক্ষ্ম, আবেগ পূর্ণ, এবং শৈলীটি এখনও অনলাইনে রয়েছে।
মিডজার্নি রেজোলিউশন বা দীর্ঘ লেন্স রোল আপ করে না, তবে একটি অনন্য পরিবেশ এবং নান্দনিক স্বীকৃতি। মিডজার্নি উচ্চাভিলাষী, "বিশ্ব মডেল" লক্ষ্য করে, কিন্তু বর্তমানে সামান্য "রুক্ষ" কার্যকরী নকশা এটিকে আরও এগিয়ে নিয়ে যেতে পারে কিনা তা এখনও অজানা।

প্রবাহ-সংরক্ষণ সংস্করণ নিম্নরূপ:
- একটি ছবি আপলোড বা জেনারেট করার পরে, শুধু "অ্যানিমেট" এ ক্লিক করুন। ডিফল্টরূপে, একটি একক কাজ 4 5-সেকেন্ডের ভিডিও আউটপুট করবে, যা সর্বোচ্চ 21 সেকেন্ড পর্যন্ত বাড়ানো যেতে পারে।
- ম্যানুয়াল এবং স্বয়ংক্রিয় মোড সমর্থন করে, এবং ব্যবহারকারীরা প্রম্পট শব্দের মাধ্যমে ছবি প্রজন্মের প্রভাব সেট করতে পারেন; যথাক্রমে স্থির বায়ুমণ্ডল বা শক্তিশালী গতিশীল দৃশ্যের জন্য উপযুক্ত নিম্ন গতি এবং উচ্চ গতির বিকল্পগুলি প্রদান করে
- ভিডিও বিদ্যমান সাবস্ক্রিপশনে অন্তর্ভুক্ত করা হয়েছে ($10/মাস) এবং গ্রাফিক্স টাস্কের তুলনায় 8 গুণ বেশি GPU রিসোর্স ব্যবহার করে
- এটি সাউন্ড ইফেক্ট, টাইমলাইন এডিটিং, ক্লিপ ট্রানজিশন বা API অ্যাক্সেস যোগ করা সমর্থন করে না। রেজোলিউশন মাত্র 480p, এবং আকৃতির অনুপাত স্বয়ংক্রিয়ভাবে চিত্রের সাথে খাপ খায়। এটি এখনও একটি প্রাথমিক সংস্করণ।
- ভিডিও মডেল একটি পর্যায়ক্রমে ফলাফল. ভবিষ্যতে, আমরা 3D মডেল এবং রিয়েল-টাইম সিস্টেম চালু করতে থাকব এবং শেষ পর্যন্ত বিশ্ব মডেলের দিকে লক্ষ্য রাখব।
মিডজার্নি ভিডিও মডেল এখন উপলব্ধ
আপনি আপনার রেজোলিউশন রোল, আমি আমার hyperreality সঙ্গে যেতে.
মিডজার্নি সবসময়ই তার ফ্যান্টাসি এবং পরাবাস্তব ভিজ্যুয়াল শৈলীর জন্য পরিচিত। বর্তমান ব্যবহারকারীদের দ্বারা পরীক্ষিত ফলাফল থেকে বিচার করে, এর ভিডিও মডেলটি একটি স্থিতিশীল শৈলী এবং উচ্চ স্বীকৃতি সহ এই নান্দনিক দিকটিও চালিয়ে যাচ্ছে।
ব্লগার @EccentrismArt দ্বারা শেয়ার করা ভিডিওতে, একটি অল্প বয়স্ক ছেলে উচ্চ উচ্চতা থেকে উল্লম্বভাবে পড়ে গেছে। চরিত্রটির মডেলিং সহজ এবং গতিশীল, যেন সে স্বপ্নে লাফ দিচ্ছে, পড়ে যাচ্ছে বা ফ্রি ফ্যাল করছে। চলাচলের পথ মসৃণ এবং চরিত্রের মাধ্যাকর্ষণ কেন্দ্র অপেক্ষাকৃত স্বাভাবিক।
শহরের ব্লকগুলি ঘনভাবে আলোতে পরিপূর্ণ, এবং বিল্ডিংগুলি স্থানিক বিকৃতির একটি চাক্ষুষ বিভ্রম তৈরি করে মহাকাশে কাত এবং ঘূর্ণায়মান বলে মনে হয়, কিন্তু সামগ্রিক বিল্ডিং ডাইনামিকসে কোনও সুস্পষ্ট ঝাঁকুনি বা AI-উত্পন্ন স্প্লিসিং ফল্ট নেই;

একটি জাপানি ট্রাম স্টেশনের দৃশ্যের এই ভিডিওতে দেখা যাচ্ছে, ট্রাম স্টেশন ছেড়ে চলে যাচ্ছে এবং সূর্য অস্ত যাওয়ার পথে। রঙের তাপমাত্রা ভালভাবে নিয়ন্ত্রিত এবং আলোর উৎস প্রাকৃতিক, যা নড়াচড়ার মধ্যে স্থিরতা এবং নড়াচড়ায় স্থিরতা তৈরি করে।

▲প্রম্পট: ট্রেনটি স্টেশনের মধ্য দিয়ে যাচ্ছে। | @PAccetturo
একটি শার্ট পরা এবং একটি নথি বা বই ধারণ করা একটি মহিলার একটি সিলুয়েট৷ তার পিছনে মানুষের মাথার বিশাল সিলুয়েট। আপনি দেখতে পাচ্ছেন যে মাল্টিপল এক্সপোজার/ওভারলে কম্পোজিশনটি খুব পরিষ্কারভাবে পরিচালনা করা হয়েছে, প্রাকৃতিক হ্যালো সহ এবং অতিরিক্ত এক্সপোজার নেই। এতে অবাক হওয়ার কিছু নেই যে Perplexity AI ডিজাইনার Phi Hoang বলেছেন যে এটি প্রত্যাশা ছাড়িয়ে গেছে।

সুপরিচিত X ব্লগার @nickfloats একটি ভিডিও শেয়ার করেছেন একটি মেয়ের একটি উজ্জ্বল আলোকিত ট্রেন প্ল্যাটফর্মে হাঁটার সাথে একটি উচ্চ-গতির ট্রেন ব্যাকগ্রাউন্ডে যাচ্ছে৷ আলো এবং ছায়ার বিভাজন ছিল সুস্পষ্ট এবং ত্রিমাত্রিক প্রভাব ছিল শক্তিশালী।

রাত, অরোরা, তুষার, গাড়ির আলো, মোশন ব্লার এবং অন্যান্য উপাদানের সহাবস্থান ভিডিও জেনারেশন মডেলের জন্য একটি বড় চ্যালেঞ্জ। যাইহোক, মডেলটি সফলভাবে একাধিক আলোর উত্সের হস্তক্ষেপ পরিচালনা করে; তুষার কণা, গাড়ির গতি ঝাপসা, এবং ট্র্যাজেক্টরি আলোর প্রভাব অত্যন্ত সামঞ্জস্যপূর্ণ।

▲প্রম্পট: 2022 ওয়ার্ল্ড র্যালি নীল সুবারু, রাতে তুষারময় ফিনল্যান্ডের মধ্য দিয়ে দৌড়, নাটকীয় অ্যাকশন শট, গতিশীল মোশন ব্লার, স্নো ফ্লাইং, আকাশে উত্তরের আলো, তুষারকে আলোকিত করে হেডলাইট, উচ্চ বৈসাদৃশ্য, সিনেমাটিক আলো | @জামিয়ান গেরার্ড
ক্লাসিক স্পেস স্যুট পরা, প্রচুর সংখ্যক রঙিন আলোক পথ মহাকাশচারীদের পিছনে প্রসারিত হয়, যা চাক্ষুষ ছন্দের একটি শক্তিশালী অনুভূতির সাথে "ভ্রমণ" বা "উচ্চ গতির আন্দোলন" এর একটি বিভ্রম তৈরি করে।

▲প্রম্পট: "একটু বাঁচুন, অ্যাসিড ফেলে দিন, এবং আমি উড়ে যাচ্ছি আমি মহাকাশে একজন মহাকাশচারীর মতো অনুভব করছি, আমি মনে করি না যে এতে ক্ষতি হবে যে তারা বলে মহাকাশে একজন নভোচারীর মতো অনুভব করা" | @জামিয়ান গেরার্ড
হাইলাইট, উপকরণ এবং তরল চলাচলের মতো উপাদানগুলি স্থির জীবন বস্তুকে প্রকাশ করার জন্য এআই মডেলের ক্ষমতা পরীক্ষা করার জন্য সমস্ত উইন্ডো। এই ভিডিওতে, আইস কিউব, ক্রিম এবং ক্যারামেলগুলি গতিশীল এবং প্রাকৃতিক এবং কাপের ঘূর্ণনের সময় লেবেলটি কোনও সুস্পষ্ট বিকৃতি দেখায় না৷

▲প্রম্পট: একটি স্টারবাক্স পানীয়, ক্লাসিক লম্বা কাপ, আইসড ক্যারামেল ম্যাকিয়াটো, ঘূর্ণায়মান ক্যারামেল গুঁড়ি, উপরে হুইপড ক্রিম, কাপে ঘনীভবন, প্রাণবন্ত এবং ক্ষুধার্ত, উচ্চ-মানের পানীয় ফটোগ্রাফি, 1:1 অনুপাত। | @জামিয়ান গেরার্ড
পরিপ্রেক্ষিত গভীরতার অনুভূতি স্পষ্ট, দূরত্ব এবং কাছাকাছি সঠিকভাবে স্তরযুক্ত, এবং বাস্তববাদী শৈলীও শক্তিশালী।

▲প্রম্পট: জঙ্গলের মাঝখানে বসে অনেক বন্য প্রাণী এস এর চারপাশে ঘুরছে | @জামিয়ান গেরার্ড
নিউ ইয়র্কের এপোক্যালিপটিক রাস্তায়, গাড়ি এবং ধ্বংসাবশেষের মতো অনেক বিবরণ রয়েছে; প্রম্পট শব্দের প্রয়োজনীয়তা অনুসারে, জেনারেট করা ভিডিওটির একটি 35 মিমি ফিল্ম টেক্সচার থাকা দরকার এবং এটি সামগ্রিকভাবে কিছুটা দানাদারও।

▲প্রম্পট: ভোরবেলা শহরের রাস্তা, যেখানে জ্বলন্ত গাড়ি এবং ধ্বংসাবশেষ ছড়িয়ে ছিটিয়ে রয়েছে। দৃশ্যটি 35 মিমি ফিল্মের দানাদার টেক্সচার সহ ফটোগ্রাফার জেফ ওয়ালের শৈলীতে ক্যাপচার করা 1990-এর দশকের নিউ ইয়র্ককে উস্কে দেয়। | @জামিয়ান গেরার্ড
ক্রিস্টাল বলটি ধীরে ধীরে ঘোরে এবং ঘোরে, যা দৃশ্যের স্থায়িত্ব পরীক্ষা করে এবং ক্যামেরার গতিবিধিও বেশ মসৃণ।

▲প্রম্পট: স্ফটিক গোলক একটি শান্ত রঙিন মাঠের উপরে ধীরে ধীরে ঘোরাফেরা করছে, স্থির ক্যাম শট | @জামিয়ান গেরার্ড
এটি লক্ষণীয় যে উপরে দেখানো কেস জেনারেশন ফলাফলগুলি "কার্ড অঙ্কন" এর একাধিক রাউন্ডের মধ্য দিয়ে যেতে পারে, তবে চূড়ান্ত প্রভাব থেকে বিচার করলে, ভিজ্যুয়াল সমাপ্তি ইতিমধ্যেই বেশ চিত্তাকর্ষক।
উচ্চাভিলাষী মিডজার্নি "বিশ্ব মডেল" এর দ্বিতীয় বিল্ডিং ব্লক তৈরি করছে
আজ থেকে, Midjourney ব্যবহারকারীরা অফিসিয়াল ওয়েবসাইটে (Midjourney.com) ছবি আপলোড করতে পারেন, অথবা সরাসরি প্ল্যাটফর্মের তৈরি ছবি ব্যবহার করতে পারেন এবং ছবিগুলিকে ভিডিওতে রূপান্তর করতে "অ্যানিমেট" বোতামে ক্লিক করতে পারেন৷
প্রতিটি কাজ 4 5-সেকেন্ডের ভিডিও তৈরি করবে, এবং ব্যবহারকারীরা 21 সেকেন্ড পর্যন্ত মোট দৈর্ঘ্য সহ, প্রতিবার 4 সেকেন্ড যোগ করে 4 বার পর্যন্ত যেকোন সেগমেন্ট প্রসারিত করতে পারে। অবশ্যই, শুরুটি কঠিন, এবং কর্মকর্তা বলেছেন যে দৈর্ঘ্য এবং কার্যকারিতা ভবিষ্যতে আরও বাড়ানো হবে।
অপারেশনাল লজিক থ্রেশহোল্ড আসলে বেশি নয়। আপনি স্বাভাবিক হিসাবে মিডজার্নিতে ছবি তৈরি করতে পারেন, কিন্তু এখন ছবি অ্যানিমেট করার জন্য একটি অতিরিক্ত পদক্ষেপ রয়েছে। এছাড়াও, আপনি "প্রাথমিক ফ্রেম" হিসাবে বাহ্যিক ছবিগুলিও আপলোড করতে পারেন এবং তারপরে আপনি যে গতিশীল প্রভাবটি উপস্থাপন করতে চান তা বর্ণনা করতে প্রম্পট শব্দ ব্যবহার করতে পারেন।
V1 ব্যবহারকারীদের ছবির বিষয়বস্তুর উপর আরো বিস্তারিত নিয়ন্ত্রণ করার অনুমতি দেওয়ার জন্য কিছু সামঞ্জস্যযোগ্য কাস্টম সেটিংস প্রদান করে।
ম্যানুয়াল মোডে, ভিডিওর উপাদানগুলি কীভাবে নড়াচড়া করে এবং দৃশ্যটি কীভাবে বিকাশ করে তা স্বয়ংক্রিয়ভাবে সেট করতে আপনি নির্দিষ্ট সংকেতগুলি প্রবেশ করতে পারেন, তবে যদি আপনার এখনও সংকেতের জন্য কোনও ধারণা না থাকে তবে আপনি একটি স্বয়ংক্রিয় সেটিং চয়ন করতে পারেন যা স্বয়ংক্রিয়ভাবে আপনার জন্য গতির সংকেত তৈরি করবে এবং চিত্রগুলিকে সরানো হবে৷

সৃজনশীল শৈলীর পরিপ্রেক্ষিতে, আপনি দুটি গতি সেটিংসের মধ্যেও বেছে নিতে পারেন:
- লো মোশন মোড: বায়ুমণ্ডলীয় দৃশ্যের জন্য উপযুক্ত, ক্যামেরা বেশিরভাগই স্থির থাকে এবং বিষয় ধীরে ধীরে বা ছন্দবদ্ধভাবে চলে। অসুবিধাটি হল যে কখনও কখনও কোনও নড়াচড়া নাও হতে পারে (যেমন লোকেদের মিটমিট করা, হাওয়া উড়ছে দৃশ্যাবলী ইত্যাদি);
- হাই মোশন মোড: লেন্স এবং বিষয় উভয়েরই প্রচুর নড়াচড়ার প্রয়োজন হয় এমন দৃশ্যের জন্য উপযুক্ত। খারাপ দিক হল যে শক্তিশালী আন্দোলন কখনও কখনও ছবির ত্রুটি বা অস্থিরতার কারণ হতে পারে।
মূল্যের পরিপ্রেক্ষিতে, ভিডিও ফাংশনটি সরাসরি মিডজার্নির সাবস্ক্রিপশন সিস্টেমে অন্তর্ভুক্ত করা হয়েছে এবং প্রারম্ভিক মূল্য এখনও প্রতি মাসে US$10।
অফিসিয়াল ব্লগ অনুসারে, মিডজার্নি প্রতি ভিডিও চিত্রের কাজগুলির তুলনায় প্রায় 8 গুণ বেশি GPU সময় নেয়, কিন্তু 20 সেকেন্ড পর্যন্ত দীর্ঘ ভিডিও তৈরি করতে সক্ষম হওয়ার প্রেক্ষিতে, প্রতি সেকেন্ডে গড় খরচ ইমেজ তৈরির প্রায় সমান। প্রতিযোগী পণ্যের সাথে তুলনা করে, এর খরচ-কার্যকারিতা প্রথম স্থানে রয়েছে।
আমরা আপনার রেফারেন্সের জন্য কিছু মূলধারার ভিডিও মডেলের সাবস্ক্রিপশন ফি সংক্ষিপ্তভাবে সাজাতে AI সার্চ ইঞ্জিন ব্যবহার করেছি। 

এছাড়াও, মিডজার্নি প্রো এবং তার বেশি গ্রাহকদের জন্য "রিল্যাক্স মোড" মোড পরীক্ষা করছে, যা প্রজন্মের কাজটিকে ধীর গতিতে সম্পন্ন করার অনুমতি দেয়, যার ফলে কম্পিউটিং সংস্থানগুলির ব্যবহার হ্রাস পায়। অন্যান্য স্তরের ব্যবহারকারীদের জন্য, তারা এখনও GPU সময় এবং সদস্যতা স্তর অনুযায়ী চার্জ করা হয়।
বর্তমানে, মিডজার্নি ভিডিও মডেল সম্পর্কে অভিযোগ করার মতো অনেক পয়েন্ট রয়েছে। সবচেয়ে সাধারণ বৈশিষ্ট্য হল পেশাদার সৃষ্টির জন্য কিছু মূল ক্ষমতার অভাব।
প্রথমত, Google-এর Veo 3 বা Luma's Dream Machine-এর বিপরীতে, Midjourney ভিডিও মডেলটি বর্তমানে স্বয়ংক্রিয়ভাবে ব্যাকগ্রাউন্ড মিউজিক বা অ্যাম্বিয়েন্ট সাউন্ড ইফেক্টের সংযোজন সমর্থন করে না। অডিও প্রয়োজন হলে, এটি এখনও অন্যান্য তৃতীয় পক্ষের সরঞ্জাম ব্যবহার করে ম্যানুয়ালি যোগ করা প্রয়োজন।
দ্বিতীয়ত, মিডজার্নি ভিডিও মডেল টাইমলাইন সম্পাদনাকে সমর্থন করে না, এবং তৈরি করা ভিডিও ক্লিপগুলি হল "জাম্প কাট", যা গল্পের ধারাবাহিকতা এবং ছবির মধ্যে স্বাভাবিক সংযোগ অর্জন করা অসম্ভব করে তোলে, প্লট ছন্দ বা মানসিক পূর্বাভাস নিয়ন্ত্রণ করা কঠিন করে তোলে।
উপরন্তু, মিডজার্নি ভিডিও মডেল বর্তমানে API অ্যাক্সেস প্রদান করে না।
আরও গুরুত্বপূর্ণ, মিডজার্নি দ্বারা উত্পন্ন ভিডিওগুলির ডিফল্ট রেজোলিউশন হল 480p (স্ট্যান্ডার্ড ডেফিনিশন), এবং ভিডিও আকৃতির অনুপাতটি ছবির আসল আকারের উপর ভিত্তি করে স্বয়ংক্রিয়ভাবে অভিযোজিত হয়৷ অন্যান্য প্ল্যাটফর্মে আপলোড করার সময় এটি 480p হিসাবে চিহ্নিত করা হবে।

▲দ্রষ্টব্য: মিডজার্নি আকৃতির অনুপাত কিছুটা সামঞ্জস্য করতে পারে এবং চূড়ান্ত আউটপুট ভিডিওর অনুপাত শুরুর চিত্র থেকে কিছুটা আলাদা হতে পারে।
মিডজার্নি কর্মকর্তারাও স্বীকার করেছেন যে বর্তমান সংস্করণটি এখনও প্রাথমিক অনুসন্ধানের পর্যায়ে রয়েছে, অ্যাক্সেসযোগ্যতা, ব্যবহারের সহজতা এবং মাপযোগ্যতার উপর দৃষ্টি নিবদ্ধ করে।
ভিডিও মডেল শুধু একটি cutaway. মিডজার্নি যা চায় তা হল আরও সম্পূর্ণ বিষয়বস্তু উৎপাদন ব্যবস্থা।
এর সরকারী পরিকল্পনা অনুসারে, চূড়ান্ত লক্ষ্য হল একটি "বিশ্ব মডেল" তৈরি করা, অর্থাৎ, ইমেজ জেনারেশন, অ্যানিমেশন নিয়ন্ত্রণ, ত্রি-মাত্রিক স্পেস নেভিগেশন এবং রিয়েল-টাইম রেন্ডারিংকে একীভূত করা।
আপনি এটিকে মনে করতে পারেন, একটি AI সিস্টেমে যা রিয়েল টাইমে ছবি তৈরি করতে পারে, আপনি AI নায়ককে 3D স্পেসে সরানোর নির্দেশ দেওয়ার জন্য একটি বাক্য ইনপুট করতে পারেন, পরিবেশের দৃশ্য সেই অনুযায়ী পরিবর্তিত হবে এবং আপনি সবকিছুর সাথে যোগাযোগ করতে পারবেন।
বিল্ডিং ব্লকের মতো, এই লক্ষ্য অর্জনের জন্য, আমাদের একটি ইমেজ মডেল প্রয়োজন (স্ট্যাটিক ইমেজ তৈরি করতে) → একটি ভিডিও মডেল (ছবিগুলিকে সরানোর জন্য) → একটি 3D মডেল (স্থানীয় নেভিগেশন এবং লেন্স চলাচল অর্জন করতে) → একটি রিয়েল-টাইম মডেল (প্রতিটি ফ্রেম সিঙ্ক্রোনাসভাবে প্রতিক্রিয়া জানাতে পারে তা নিশ্চিত করার জন্য)।
মিডজার্নির পণ্য পরিকল্পনা অনুসারে, এই চারটি প্রযুক্তিগত "বিল্ডিং ব্লক" পরবর্তী 12 মাসের মধ্যে বিতরণ করা হবে এবং অবশেষে একটি ইউনিফাইড সিস্টেমে একীভূত করা হবে। V1 ভিডিও মডেল, পর্যায়ক্রমে ফলাফল হিসাবে, এই চূড়ান্ত লক্ষ্যের দ্বিতীয় ধাপ।
#iFanr: iFanr (WeChat ID: ifanr) এর অফিসিয়াল WeChat পাবলিক অ্যাকাউন্ট অনুসরণ করতে স্বাগতম, যেখানে যত তাড়াতাড়ি সম্ভব আরও উত্তেজনাপূর্ণ বিষয়বস্তু আপনার কাছে উপস্থাপন করা হবে।
