Image-Text-to-Video
Diffusers
Safetensors
text-to-video
image-to-video
video-to-video
text-to-audio-video
image-to-audio-video
image-text-to-audio-video
video-to-audio-video
audio-to-audio-video
audio-video-generation
multimodal
synchronized-audio-video
reference-to-audio-video
Instructions to use MiniMaxAI/MiniMax-H3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use MiniMaxAI/MiniMax-H3 with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("MiniMaxAI/MiniMax-H3", dtype=torch.bfloat16, device_map="cuda") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
H3-Context-IR未来会开源吗?
#14
by limn3022 - opened
rt
H3-Context-IR 由于是一系列模型的组合,技术上无法开源。我们后续会尝试用新的技术架构解决
那能不能把workflow 给端出来?
我们之后讲一下思路,相信社区的力量
期待开放思路报告
我们之后讲一下思路,相信社区的力量
完全可以理解,看得出来生成那一套结构化提示词需要很复杂的多模态理解以及视觉规划能力。能把H3-Context-IR 的输出选为人类能理解的自然语言而非latent embedding,想要嵌入工作流就只是时间功夫了,大不了能工智人嘛。
我看现在comfy官方没有放出H3-Regenerate-2K的工作流,看技术实现是不是应该用ref2va的模型来参考原视频生成,只是目前还没封装成节点对吧?