এই এআই ইমেজ জেনারেটরটি তার প্রথম ভিডিও মডেল প্রকাশ করেছে: কোন রেজোলিউশন নেই, কিন্তু নেটিজেনরা বলেছেন ছবিটি আশ্চর্যজনক এবং প্রত্যাশা ছাড়িয়ে গেছে প্রম্পট শব্দ দিয়ে

ডিজনি এবং ইউনিভার্সাল পিকচার্সের কাছ থেকে কপিরাইট মামলার সম্মুখীন হয়েও, অভিজ্ঞ গ্রাফিক ডিজাইন "ইউনিকর্ন" মিডজার্নি তার গতি কমিয়ে দেয়নি। পরিবর্তে, এটি চাপের মধ্যে আজ সকালে তার প্রথম ভিডিও মডেল চালু করেছে।

রঙের মিল সুনির্দিষ্ট, রচনাটি সূক্ষ্ম, আবেগ পূর্ণ, এবং শৈলীটি এখনও অনলাইনে রয়েছে।

মিডজার্নি রেজোলিউশন বা দীর্ঘ লেন্স রোল আপ করে না, তবে একটি অনন্য পরিবেশ এবং নান্দনিক স্বীকৃতি। মিডজার্নি উচ্চাভিলাষী, "বিশ্ব মডেল" লক্ষ্য করে, কিন্তু বর্তমানে সামান্য "রুক্ষ" কার্যকরী নকশা এটিকে আরও এগিয়ে নিয়ে যেতে পারে কিনা তা এখনও অজানা।

প্রবাহ-সংরক্ষণ সংস্করণ নিম্নরূপ:

  • একটি ছবি আপলোড বা জেনারেট করার পরে, শুধু "অ্যানিমেট" এ ক্লিক করুন। ডিফল্টরূপে, একটি একক কাজ 4 5-সেকেন্ডের ভিডিও আউটপুট করবে, যা সর্বোচ্চ 21 সেকেন্ড পর্যন্ত বাড়ানো যেতে পারে।
  • ম্যানুয়াল এবং স্বয়ংক্রিয় মোড সমর্থন করে, এবং ব্যবহারকারীরা প্রম্পট শব্দের মাধ্যমে ছবি প্রজন্মের প্রভাব সেট করতে পারেন; যথাক্রমে স্থির বায়ুমণ্ডল বা শক্তিশালী গতিশীল দৃশ্যের জন্য উপযুক্ত নিম্ন গতি এবং উচ্চ গতির বিকল্পগুলি প্রদান করে
  • ভিডিও বিদ্যমান সাবস্ক্রিপশনে অন্তর্ভুক্ত করা হয়েছে ($10/মাস) এবং গ্রাফিক্স টাস্কের তুলনায় 8 গুণ বেশি GPU রিসোর্স ব্যবহার করে
  • এটি সাউন্ড ইফেক্ট, টাইমলাইন এডিটিং, ক্লিপ ট্রানজিশন বা API অ্যাক্সেস যোগ করা সমর্থন করে না। রেজোলিউশন মাত্র 480p, এবং আকৃতির অনুপাত স্বয়ংক্রিয়ভাবে চিত্রের সাথে খাপ খায়। এটি এখনও একটি প্রাথমিক সংস্করণ।
  • ভিডিও মডেল একটি পর্যায়ক্রমে ফলাফল. ভবিষ্যতে, আমরা 3D মডেল এবং রিয়েল-টাইম সিস্টেম চালু করতে থাকব এবং শেষ পর্যন্ত বিশ্ব মডেলের দিকে লক্ষ্য রাখব।

মিডজার্নি ভিডিও মডেল এখন উপলব্ধ

আপনি আপনার রেজোলিউশন রোল, আমি আমার hyperreality সঙ্গে যেতে.

মিডজার্নি সবসময়ই তার ফ্যান্টাসি এবং পরাবাস্তব ভিজ্যুয়াল শৈলীর জন্য পরিচিত। বর্তমান ব্যবহারকারীদের দ্বারা পরীক্ষিত ফলাফল থেকে বিচার করে, এর ভিডিও মডেলটি একটি স্থিতিশীল শৈলী এবং উচ্চ স্বীকৃতি সহ এই নান্দনিক দিকটিও চালিয়ে যাচ্ছে।

ব্লগার @EccentrismArt দ্বারা শেয়ার করা ভিডিওতে, একটি অল্প বয়স্ক ছেলে উচ্চ উচ্চতা থেকে উল্লম্বভাবে পড়ে গেছে। চরিত্রটির মডেলিং সহজ এবং গতিশীল, যেন সে স্বপ্নে লাফ দিচ্ছে, পড়ে যাচ্ছে বা ফ্রি ফ্যাল করছে। চলাচলের পথ মসৃণ এবং চরিত্রের মাধ্যাকর্ষণ কেন্দ্র অপেক্ষাকৃত স্বাভাবিক।

শহরের ব্লকগুলি ঘনভাবে আলোতে পরিপূর্ণ, এবং বিল্ডিংগুলি স্থানিক বিকৃতির একটি চাক্ষুষ বিভ্রম তৈরি করে মহাকাশে কাত এবং ঘূর্ণায়মান বলে মনে হয়, কিন্তু সামগ্রিক বিল্ডিং ডাইনামিকসে কোনও সুস্পষ্ট ঝাঁকুনি বা AI-উত্পন্ন স্প্লিসিং ফল্ট নেই;

একটি জাপানি ট্রাম স্টেশনের দৃশ্যের এই ভিডিওতে দেখা যাচ্ছে, ট্রাম স্টেশন ছেড়ে চলে যাচ্ছে এবং সূর্য অস্ত যাওয়ার পথে। রঙের তাপমাত্রা ভালভাবে নিয়ন্ত্রিত এবং আলোর উৎস প্রাকৃতিক, যা নড়াচড়ার মধ্যে স্থিরতা এবং নড়াচড়ায় স্থিরতা তৈরি করে।

▲প্রম্পট: ট্রেনটি স্টেশনের মধ্য দিয়ে যাচ্ছে। | @PAccetturo

একটি শার্ট পরা এবং একটি নথি বা বই ধারণ করা একটি মহিলার একটি সিলুয়েট৷ তার পিছনে মানুষের মাথার বিশাল সিলুয়েট। আপনি দেখতে পাচ্ছেন যে মাল্টিপল এক্সপোজার/ওভারলে কম্পোজিশনটি খুব পরিষ্কারভাবে পরিচালনা করা হয়েছে, প্রাকৃতিক হ্যালো সহ এবং অতিরিক্ত এক্সপোজার নেই। এতে অবাক হওয়ার কিছু নেই যে Perplexity AI ডিজাইনার Phi Hoang বলেছেন যে এটি প্রত্যাশা ছাড়িয়ে গেছে।

সুপরিচিত X ব্লগার @nickfloats একটি ভিডিও শেয়ার করেছেন একটি মেয়ের একটি উজ্জ্বল আলোকিত ট্রেন প্ল্যাটফর্মে হাঁটার সাথে একটি উচ্চ-গতির ট্রেন ব্যাকগ্রাউন্ডে যাচ্ছে৷ আলো এবং ছায়ার বিভাজন ছিল সুস্পষ্ট এবং ত্রিমাত্রিক প্রভাব ছিল শক্তিশালী।

রাত, অরোরা, তুষার, গাড়ির আলো, মোশন ব্লার এবং অন্যান্য উপাদানের সহাবস্থান ভিডিও জেনারেশন মডেলের জন্য একটি বড় চ্যালেঞ্জ। যাইহোক, মডেলটি সফলভাবে একাধিক আলোর উত্সের হস্তক্ষেপ পরিচালনা করে; তুষার কণা, গাড়ির গতি ঝাপসা, এবং ট্র্যাজেক্টরি আলোর প্রভাব অত্যন্ত সামঞ্জস্যপূর্ণ।

▲প্রম্পট: 2022 ওয়ার্ল্ড র‍্যালি নীল সুবারু, রাতে তুষারময় ফিনল্যান্ডের মধ্য দিয়ে দৌড়, নাটকীয় অ্যাকশন শট, গতিশীল মোশন ব্লার, স্নো ফ্লাইং, আকাশে উত্তরের আলো, তুষারকে আলোকিত করে হেডলাইট, উচ্চ বৈসাদৃশ্য, সিনেমাটিক আলো | @জামিয়ান গেরার্ড

ক্লাসিক স্পেস স্যুট পরা, প্রচুর সংখ্যক রঙিন আলোক পথ মহাকাশচারীদের পিছনে প্রসারিত হয়, যা চাক্ষুষ ছন্দের একটি শক্তিশালী অনুভূতির সাথে "ভ্রমণ" বা "উচ্চ গতির আন্দোলন" এর একটি বিভ্রম তৈরি করে।

▲প্রম্পট: "একটু বাঁচুন, অ্যাসিড ফেলে দিন, এবং আমি উড়ে যাচ্ছি আমি মহাকাশে একজন মহাকাশচারীর মতো অনুভব করছি, আমি মনে করি না যে এতে ক্ষতি হবে যে তারা বলে মহাকাশে একজন নভোচারীর মতো অনুভব করা" | @জামিয়ান গেরার্ড

হাইলাইট, উপকরণ এবং তরল চলাচলের মতো উপাদানগুলি স্থির জীবন বস্তুকে প্রকাশ করার জন্য এআই মডেলের ক্ষমতা পরীক্ষা করার জন্য সমস্ত উইন্ডো। এই ভিডিওতে, আইস কিউব, ক্রিম এবং ক্যারামেলগুলি গতিশীল এবং প্রাকৃতিক এবং কাপের ঘূর্ণনের সময় লেবেলটি কোনও সুস্পষ্ট বিকৃতি দেখায় না৷

▲প্রম্পট: একটি স্টারবাক্স পানীয়, ক্লাসিক লম্বা কাপ, আইসড ক্যারামেল ম্যাকিয়াটো, ঘূর্ণায়মান ক্যারামেল গুঁড়ি, উপরে হুইপড ক্রিম, কাপে ঘনীভবন, প্রাণবন্ত এবং ক্ষুধার্ত, উচ্চ-মানের পানীয় ফটোগ্রাফি, 1:1 অনুপাত। | @জামিয়ান গেরার্ড

পরিপ্রেক্ষিত গভীরতার অনুভূতি স্পষ্ট, দূরত্ব এবং কাছাকাছি সঠিকভাবে স্তরযুক্ত, এবং বাস্তববাদী শৈলীও শক্তিশালী।

▲প্রম্পট: জঙ্গলের মাঝখানে বসে অনেক বন্য প্রাণী এস এর চারপাশে ঘুরছে | @জামিয়ান গেরার্ড

নিউ ইয়র্কের এপোক্যালিপটিক রাস্তায়, গাড়ি এবং ধ্বংসাবশেষের মতো অনেক বিবরণ রয়েছে; প্রম্পট শব্দের প্রয়োজনীয়তা অনুসারে, জেনারেট করা ভিডিওটির একটি 35 মিমি ফিল্ম টেক্সচার থাকা দরকার এবং এটি সামগ্রিকভাবে কিছুটা দানাদারও।

▲প্রম্পট: ভোরবেলা শহরের রাস্তা, যেখানে জ্বলন্ত গাড়ি এবং ধ্বংসাবশেষ ছড়িয়ে ছিটিয়ে রয়েছে। দৃশ্যটি 35 মিমি ফিল্মের দানাদার টেক্সচার সহ ফটোগ্রাফার জেফ ওয়ালের শৈলীতে ক্যাপচার করা 1990-এর দশকের নিউ ইয়র্ককে উস্কে দেয়। | @জামিয়ান গেরার্ড

ক্রিস্টাল বলটি ধীরে ধীরে ঘোরে এবং ঘোরে, যা দৃশ্যের স্থায়িত্ব পরীক্ষা করে এবং ক্যামেরার গতিবিধিও বেশ মসৃণ।

▲প্রম্পট: স্ফটিক গোলক একটি শান্ত রঙিন মাঠের উপরে ধীরে ধীরে ঘোরাফেরা করছে, স্থির ক্যাম শট | @জামিয়ান গেরার্ড

এটি লক্ষণীয় যে উপরে দেখানো কেস জেনারেশন ফলাফলগুলি "কার্ড অঙ্কন" এর একাধিক রাউন্ডের মধ্য দিয়ে যেতে পারে, তবে চূড়ান্ত প্রভাব থেকে বিচার করলে, ভিজ্যুয়াল সমাপ্তি ইতিমধ্যেই বেশ চিত্তাকর্ষক।

উচ্চাভিলাষী মিডজার্নি "বিশ্ব মডেল" এর দ্বিতীয় বিল্ডিং ব্লক তৈরি করছে

আজ থেকে, Midjourney ব্যবহারকারীরা অফিসিয়াল ওয়েবসাইটে (Midjourney.com) ছবি আপলোড করতে পারেন, অথবা সরাসরি প্ল্যাটফর্মের তৈরি ছবি ব্যবহার করতে পারেন এবং ছবিগুলিকে ভিডিওতে রূপান্তর করতে "অ্যানিমেট" বোতামে ক্লিক করতে পারেন৷

প্রতিটি কাজ 4 5-সেকেন্ডের ভিডিও তৈরি করবে, এবং ব্যবহারকারীরা 21 সেকেন্ড পর্যন্ত মোট দৈর্ঘ্য সহ, প্রতিবার 4 সেকেন্ড যোগ করে 4 বার পর্যন্ত যেকোন সেগমেন্ট প্রসারিত করতে পারে। অবশ্যই, শুরুটি কঠিন, এবং কর্মকর্তা বলেছেন যে দৈর্ঘ্য এবং কার্যকারিতা ভবিষ্যতে আরও বাড়ানো হবে।

অপারেশনাল লজিক থ্রেশহোল্ড আসলে বেশি নয়। আপনি স্বাভাবিক হিসাবে মিডজার্নিতে ছবি তৈরি করতে পারেন, কিন্তু এখন ছবি অ্যানিমেট করার জন্য একটি অতিরিক্ত পদক্ষেপ রয়েছে। এছাড়াও, আপনি "প্রাথমিক ফ্রেম" হিসাবে বাহ্যিক ছবিগুলিও আপলোড করতে পারেন এবং তারপরে আপনি যে গতিশীল প্রভাবটি উপস্থাপন করতে চান তা বর্ণনা করতে প্রম্পট শব্দ ব্যবহার করতে পারেন।

V1 ব্যবহারকারীদের ছবির বিষয়বস্তুর উপর আরো বিস্তারিত নিয়ন্ত্রণ করার অনুমতি দেওয়ার জন্য কিছু সামঞ্জস্যযোগ্য কাস্টম সেটিংস প্রদান করে।

ম্যানুয়াল মোডে, ভিডিওর উপাদানগুলি কীভাবে নড়াচড়া করে এবং দৃশ্যটি কীভাবে বিকাশ করে তা স্বয়ংক্রিয়ভাবে সেট করতে আপনি নির্দিষ্ট সংকেতগুলি প্রবেশ করতে পারেন, তবে যদি আপনার এখনও সংকেতের জন্য কোনও ধারণা না থাকে তবে আপনি একটি স্বয়ংক্রিয় সেটিং চয়ন করতে পারেন যা স্বয়ংক্রিয়ভাবে আপনার জন্য গতির সংকেত তৈরি করবে এবং চিত্রগুলিকে সরানো হবে৷

সৃজনশীল শৈলীর পরিপ্রেক্ষিতে, আপনি দুটি গতি সেটিংসের মধ্যেও বেছে নিতে পারেন:

  • লো মোশন মোড: বায়ুমণ্ডলীয় দৃশ্যের জন্য উপযুক্ত, ক্যামেরা বেশিরভাগই স্থির থাকে এবং বিষয় ধীরে ধীরে বা ছন্দবদ্ধভাবে চলে। অসুবিধাটি হল যে কখনও কখনও কোনও নড়াচড়া নাও হতে পারে (যেমন লোকেদের মিটমিট করা, হাওয়া উড়ছে দৃশ্যাবলী ইত্যাদি);
  • হাই মোশন মোড: লেন্স এবং বিষয় উভয়েরই প্রচুর নড়াচড়ার প্রয়োজন হয় এমন দৃশ্যের জন্য উপযুক্ত। খারাপ দিক হল যে শক্তিশালী আন্দোলন কখনও কখনও ছবির ত্রুটি বা অস্থিরতার কারণ হতে পারে।

মূল্যের পরিপ্রেক্ষিতে, ভিডিও ফাংশনটি সরাসরি মিডজার্নির সাবস্ক্রিপশন সিস্টেমে অন্তর্ভুক্ত করা হয়েছে এবং প্রারম্ভিক মূল্য এখনও প্রতি মাসে US$10।

অফিসিয়াল ব্লগ অনুসারে, মিডজার্নি প্রতি ভিডিও চিত্রের কাজগুলির তুলনায় প্রায় 8 গুণ বেশি GPU সময় নেয়, কিন্তু 20 সেকেন্ড পর্যন্ত দীর্ঘ ভিডিও তৈরি করতে সক্ষম হওয়ার প্রেক্ষিতে, প্রতি সেকেন্ডে গড় খরচ ইমেজ তৈরির প্রায় সমান। প্রতিযোগী পণ্যের সাথে তুলনা করে, এর খরচ-কার্যকারিতা প্রথম স্থানে রয়েছে।

আমরা আপনার রেফারেন্সের জন্য কিছু মূলধারার ভিডিও মডেলের সাবস্ক্রিপশন ফি সংক্ষিপ্তভাবে সাজাতে AI সার্চ ইঞ্জিন ব্যবহার করেছি।

এছাড়াও, মিডজার্নি প্রো এবং তার বেশি গ্রাহকদের জন্য "রিল্যাক্স মোড" মোড পরীক্ষা করছে, যা প্রজন্মের কাজটিকে ধীর গতিতে সম্পন্ন করার অনুমতি দেয়, যার ফলে কম্পিউটিং সংস্থানগুলির ব্যবহার হ্রাস পায়। অন্যান্য স্তরের ব্যবহারকারীদের জন্য, তারা এখনও GPU সময় এবং সদস্যতা স্তর অনুযায়ী চার্জ করা হয়।

বর্তমানে, মিডজার্নি ভিডিও মডেল সম্পর্কে অভিযোগ করার মতো অনেক পয়েন্ট রয়েছে। সবচেয়ে সাধারণ বৈশিষ্ট্য হল পেশাদার সৃষ্টির জন্য কিছু মূল ক্ষমতার অভাব।

প্রথমত, Google-এর Veo 3 বা Luma's Dream Machine-এর বিপরীতে, Midjourney ভিডিও মডেলটি বর্তমানে স্বয়ংক্রিয়ভাবে ব্যাকগ্রাউন্ড মিউজিক বা অ্যাম্বিয়েন্ট সাউন্ড ইফেক্টের সংযোজন সমর্থন করে না। অডিও প্রয়োজন হলে, এটি এখনও অন্যান্য তৃতীয় পক্ষের সরঞ্জাম ব্যবহার করে ম্যানুয়ালি যোগ করা প্রয়োজন।

দ্বিতীয়ত, মিডজার্নি ভিডিও মডেল টাইমলাইন সম্পাদনাকে সমর্থন করে না, এবং তৈরি করা ভিডিও ক্লিপগুলি হল "জাম্প কাট", যা গল্পের ধারাবাহিকতা এবং ছবির মধ্যে স্বাভাবিক সংযোগ অর্জন করা অসম্ভব করে তোলে, প্লট ছন্দ বা মানসিক পূর্বাভাস নিয়ন্ত্রণ করা কঠিন করে তোলে।

উপরন্তু, মিডজার্নি ভিডিও মডেল বর্তমানে API অ্যাক্সেস প্রদান করে না।

আরও গুরুত্বপূর্ণ, মিডজার্নি দ্বারা উত্পন্ন ভিডিওগুলির ডিফল্ট রেজোলিউশন হল 480p (স্ট্যান্ডার্ড ডেফিনিশন), এবং ভিডিও আকৃতির অনুপাতটি ছবির আসল আকারের উপর ভিত্তি করে স্বয়ংক্রিয়ভাবে অভিযোজিত হয়৷ অন্যান্য প্ল্যাটফর্মে আপলোড করার সময় এটি 480p হিসাবে চিহ্নিত করা হবে।

▲দ্রষ্টব্য: মিডজার্নি আকৃতির অনুপাত কিছুটা সামঞ্জস্য করতে পারে এবং চূড়ান্ত আউটপুট ভিডিওর অনুপাত শুরুর চিত্র থেকে কিছুটা আলাদা হতে পারে।

মিডজার্নি কর্মকর্তারাও স্বীকার করেছেন যে বর্তমান সংস্করণটি এখনও প্রাথমিক অনুসন্ধানের পর্যায়ে রয়েছে, অ্যাক্সেসযোগ্যতা, ব্যবহারের সহজতা এবং মাপযোগ্যতার উপর দৃষ্টি নিবদ্ধ করে।

ভিডিও মডেল শুধু একটি cutaway. মিডজার্নি যা চায় তা হল আরও সম্পূর্ণ বিষয়বস্তু উৎপাদন ব্যবস্থা।

এর সরকারী পরিকল্পনা অনুসারে, চূড়ান্ত লক্ষ্য হল একটি "বিশ্ব মডেল" তৈরি করা, অর্থাৎ, ইমেজ জেনারেশন, অ্যানিমেশন নিয়ন্ত্রণ, ত্রি-মাত্রিক স্পেস নেভিগেশন এবং রিয়েল-টাইম রেন্ডারিংকে একীভূত করা।

আপনি এটিকে মনে করতে পারেন, একটি AI সিস্টেমে যা রিয়েল টাইমে ছবি তৈরি করতে পারে, আপনি AI নায়ককে 3D স্পেসে সরানোর নির্দেশ দেওয়ার জন্য একটি বাক্য ইনপুট করতে পারেন, পরিবেশের দৃশ্য সেই অনুযায়ী পরিবর্তিত হবে এবং আপনি সবকিছুর সাথে যোগাযোগ করতে পারবেন।

বিল্ডিং ব্লকের মতো, এই লক্ষ্য অর্জনের জন্য, আমাদের একটি ইমেজ মডেল প্রয়োজন (স্ট্যাটিক ইমেজ তৈরি করতে) → একটি ভিডিও মডেল (ছবিগুলিকে সরানোর জন্য) → একটি 3D মডেল (স্থানীয় নেভিগেশন এবং লেন্স চলাচল অর্জন করতে) → একটি রিয়েল-টাইম মডেল (প্রতিটি ফ্রেম সিঙ্ক্রোনাসভাবে প্রতিক্রিয়া জানাতে পারে তা নিশ্চিত করার জন্য)।

মিডজার্নির পণ্য পরিকল্পনা অনুসারে, এই চারটি প্রযুক্তিগত "বিল্ডিং ব্লক" পরবর্তী 12 মাসের মধ্যে বিতরণ করা হবে এবং অবশেষে একটি ইউনিফাইড সিস্টেমে একীভূত করা হবে। V1 ভিডিও মডেল, পর্যায়ক্রমে ফলাফল হিসাবে, এই চূড়ান্ত লক্ষ্যের দ্বিতীয় ধাপ।

#iFanr: iFanr (WeChat ID: ifanr) এর অফিসিয়াল WeChat পাবলিক অ্যাকাউন্ট অনুসরণ করতে স্বাগতম, যেখানে যত তাড়াতাড়ি সম্ভব আরও উত্তেজনাপূর্ণ বিষয়বস্তু আপনার কাছে উপস্থাপন করা হবে।

iFanr | মূল লিঙ্ক · মন্তব্য দেখুন · সিনা ওয়েইবো