
مدل Wan2.2 یکی از پیشرفتهترین مدلهای هوش مصنوعی آفلاین تولید ویدیو در سال ۲۰۲۵–۲۰۲۶ است که توسط تیم Wan AI (مرتبط با آزمایشگاه Tongyi علیبابا) توسعه یافته و به صورت open-source منتشر شده است.
این مدل با معماری Mixture-of-Experts (MoE) کار میکند و امکان اجرای کاملاً آفلاین و بدون نیاز به اینترنت را روی سیستم شخصی فراهم میکند. Wan2.2 در دو نسخه اصلی عرضه شده: نسخه سبک ۵ میلیارد پارامتری (TI2V-5B) که روی کارت گرافیکهای مصرفی مثل RTX 4090 یا حتی کارتهای ۸ گیگابایتی با بهینهسازی اجرا میشود و نسخههای سنگینتر ۱۴ میلیارد پارامتری (T2V-A14B و I2V-A14B) که کیفیت بالاتری ارائه میدهند. این مدل قابلیت تولید ویدیوهای 720p با ۲۴ فریم در ثانیه را دارد و در ابزارهایی مثل ComfyUI بهراحتی قابل نصب و استفاده است.
کاربردهای Wan2.2 شامل
- ساخت ویدیو از متن (Text-to-Video)
- تبدیل عکس به ویدیو (Image-to-Video)
- انیمیشنسازی کاراکترها (Wan2.2 Animate)
- تولید محتوای سینمایی با کنترل زیباییشناختی بالا
- ساخت کلیپهای تبلیغاتی، انیمیشن کوتاه
- محتوای آموزشی و حتی تولید ویدیوهای شخصیسازیشده (از جمله NSFW با استفاده از LoRAهای مناسب) است.
ویژگی کلیدی آن معماری MoE هوشمند، فشردهسازی پیشرفته VAE (نسبت ۱۶×۱۶×۴)، کیفیت حرکتی بسیار طبیعی، پشتیبانی از رزولوشن HD، سرعت تولید نسبتاً بالا در مقایسه با مدلهای مشابه و امکان اجرای کاملاً محلی و خصوصی بدون ارسال داده به سرور است.
سیستم مورد نیاز
برای نسخه سبک ۵B حدود ۸–۱۲ گیگابایت VRAM (با offloading و quantization حتی روی ۸ گیگ قابل اجرا است)، رم حداقل ۱۶–۳۲ گیگابایت و کارت گرافیک NVIDIA سری ۳۰ یا ۴۰ پیشنهاد میشود. نسخههای ۱۴B معمولاً به ۱۶–۲۴ گیگابایت VRAM نیاز دارند (با GGUF و بهینهسازی میتوان مصرف را کاهش داد). نصب از طریق ComfyUI یا Diffusers امکانپذیر است و مدلها از Hugging Face قابل دانلود هستند.
نکته مهم: برای ویدئو، قدرت GPU خیلی مهم است، حداقل ۱۶GB RAM پیشنهاد میشود و هرچه VRAM بیشتر باشه راحتتر است.