RUM-Flux.2-Klein-4B是1个多功能的2次元图像模型,支持:

  • 文生图和图像编辑
  • danbooru tags和自然语言
  • 角色和画师串

项目地址: https://github.com/RimoChan/RUM

使用方法

  • diffusers用户

    • 可以参考Git仓库里的推理.py,模型路径和prompt都硬编码在文件里,改1下常量然后用python跑就可以了。此外,样例的prompt也在推理.py文件里可以复现。
  • ComfyUI用户

    • 聪明群友帮我写了1个ComfyUI-RUM,可以用它来跑。

编辑的用法

Prompt可以参考上面这张例图,大体上就是你想要什么就加什么,不想要什么就写remove 它

编辑倒也不是那么灵敏,不过好在我测试出了1些秘法,如果遇到响应有问题的情况,可以试试:

  • 在Prompt的前面加上/去掉change to
  • 把英文翻译成中文。
  • 加上/去掉1girl
  • 使用负面Prompt,比如模型老想把背景换掉,可以在负面里加上换背景,它就不换了。
  • 如果发现矫枉过正,比如编辑的部分颜色太深,可以把CFG改小1点。
  • 换seed多试几次。

这样多换几次它总会响应的!

此外,因为编辑本身计算量比较大,如果嫌测试prompt慢的话,可以先把图片resize到512,测好prompt之后,再用原本的的size推理。

1些编辑的case

梗图很好玩所以就都贴进来了!

T2I的Prompt

T2I的Prompt基本就是原版的Illustrious,是person count, character names, rating, general tags, artist, year modifier,比如:

  • 1girl, kisaki (blue archive), general, holding baozi, eating, indoors, momoko (momopoco), newest

除了person count和character names以外的部分训练时都有dropout,所以也可以不填。

训练时是没有自然语言的prompt的。不过因为没有训Text Encoder的部分,可能Qwen本身对得比较齐或者怎么样,自然语言居然也是可以用的。

不过不能写的太简略,最好是推理前找LLM帮忙把句子扩充1下,比如说:

  • 1girl, a quick girl jumps over the lazy dog
    • 这个不行。
  • 1girl, momoi (blue archive), baram, starshadowmagician 她正以在半空中进行一次充满活力的跳跃,身体直接跨越过一只毛茸茸的大狗。那只狗正四肢平摊地趴在绿色的草坪上呼呼大睡,看起来极其慵懒,对她的动作毫无察觉。她脸上带着快乐且调皮的表情。她的动作极具动感,悬浮在空中,双手展开,双腿微微收拢以避开身下的动物。整个场景发生在一个阳光明媚的公园里,她的衣服因为迅速的跳跃动作而在风中剧烈飘动。
    • 这个可以,出图的效果是下面这样。

风格融合

可以把多个艺术家的风格做融合,操作方法也和Illustrious 1样,用逗号组成画师串就可以了。效果像是这样,上面是2个画师分别推理的结果,下面是组合在1起推理的结果。

关于分辨率

训练时的分辨率是196-1280,所以大家尽量在这个范围里用就好了。

不过,实际上测试下来发现是能直出2000分辨率的大图的,更大的尺寸会出现各种怪东西,但其实也没必要,这样太慢了,生成中等尺寸再用小1点的模型超分会更好。

其他参数

CFG建议开5。可能是因为数据构造的问题,正负方向非常接近,所以范围很大,开到15也能跑。不过因为我其实是色盲,等下颜色不对你问我我也只能说「看起来很正常啊」。

num_inference_steps建议开20。算法介绍的页面有解释它为什么不是1个步数蒸馏的模型。

剩下的就保持默认吧,应该也没什么可调的了。

结束

就这样,大家88,我要去召唤究极至高的隼了!

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for rimochan/RUM-FLUX.2-klein-4B

Finetuned
(21)
this model