Instructions to use rimochan/RUM-FLUX.2-klein-4B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use rimochan/RUM-FLUX.2-klein-4B with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline from diffusers.utils import load_image # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("rimochan/RUM-FLUX.2-klein-4B", dtype=torch.bfloat16, device_map="cuda") prompt = "Turn this cat into a dog" input_image = load_image("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/diffusers/cat.png") image = pipe(image=input_image, prompt=prompt).images[0] - Notebooks
- Google Colab
- Kaggle
RUM-Flux.2-Klein-4B是1个多功能的2次元图像模型,支持:
- 文生图和图像编辑
- danbooru tags和自然语言
- 角色和画师串
项目地址: https://github.com/RimoChan/RUM
使用方法
diffusers用户
- 可以参考Git仓库里的
推理.py,模型路径和prompt都硬编码在文件里,改1下常量然后用python跑就可以了。此外,样例的prompt也在推理.py文件里可以复现。
- 可以参考Git仓库里的
ComfyUI用户
- 聪明群友帮我写了1个ComfyUI-RUM,可以用它来跑。
编辑的用法
Prompt可以参考上面这张例图,大体上就是你想要什么就加什么,不想要什么就写remove 它。
编辑倒也不是那么灵敏,不过好在我测试出了1些秘法,如果遇到响应有问题的情况,可以试试:
- 在Prompt的前面加上/去掉
change to。 - 把英文翻译成中文。
- 加上/去掉
1girl。 - 使用负面Prompt,比如模型老想把背景换掉,可以在负面里加上换背景,它就不换了。
- 如果发现矫枉过正,比如编辑的部分颜色太深,可以把CFG改小1点。
- 换seed多试几次。
这样多换几次它总会响应的!
此外,因为编辑本身计算量比较大,如果嫌测试prompt慢的话,可以先把图片resize到512,测好prompt之后,再用原本的的size推理。
1些编辑的case
梗图很好玩所以就都贴进来了!
T2I的Prompt
T2I的Prompt基本就是原版的Illustrious,是person count, character names, rating, general tags, artist, year modifier,比如:
1girl, kisaki (blue archive), general, holding baozi, eating, indoors, momoko (momopoco), newest
除了person count和character names以外的部分训练时都有dropout,所以也可以不填。
训练时是没有自然语言的prompt的。不过因为没有训Text Encoder的部分,可能Qwen本身对得比较齐或者怎么样,自然语言居然也是可以用的。
不过不能写的太简略,最好是推理前找LLM帮忙把句子扩充1下,比如说:
1girl, a quick girl jumps over the lazy dog- 这个不行。
1girl, momoi (blue archive), baram, starshadowmagician 她正以在半空中进行一次充满活力的跳跃,身体直接跨越过一只毛茸茸的大狗。那只狗正四肢平摊地趴在绿色的草坪上呼呼大睡,看起来极其慵懒,对她的动作毫无察觉。她脸上带着快乐且调皮的表情。她的动作极具动感,悬浮在空中,双手展开,双腿微微收拢以避开身下的动物。整个场景发生在一个阳光明媚的公园里,她的衣服因为迅速的跳跃动作而在风中剧烈飘动。- 这个可以,出图的效果是下面这样。
风格融合
可以把多个艺术家的风格做融合,操作方法也和Illustrious 1样,用逗号组成画师串就可以了。效果像是这样,上面是2个画师分别推理的结果,下面是组合在1起推理的结果。
关于分辨率
训练时的分辨率是196-1280,所以大家尽量在这个范围里用就好了。
不过,实际上测试下来发现是能直出2000分辨率的大图的,更大的尺寸会出现各种怪东西,但其实也没必要,这样太慢了,生成中等尺寸再用小1点的模型超分会更好。
其他参数
CFG建议开5。可能是因为数据构造的问题,正负方向非常接近,所以范围很大,开到15也能跑。不过因为我其实是色盲,等下颜色不对你问我我也只能说「看起来很正常啊」。
num_inference_steps建议开20。算法介绍的页面有解释它为什么不是1个步数蒸馏的模型。
剩下的就保持默认吧,应该也没什么可调的了。
结束
就这样,大家88,我要去召唤究极至高的隼了!
- Downloads last month
- -
Model tree for rimochan/RUM-FLUX.2-klein-4B
Base model
black-forest-labs/FLUX.2-klein-base-4B