差什么来什么2
前两天刚说到这次开发总是遇到差什么就来什么的情况,这两天又碰到了:Qwen Image 2.1。
其实出于经济原因考虑,我这边出图——特别是首尾帧的图,还有场景、角色的一些造型——只有最开始做设定的时候用了 GPT Image 2,后来批量生产就用不起这么贵的模型了。一张图虽然也才 4 分钱,但要用的量非常大,每一期出个几十张也要一两块钱,长期累积下来是相当可观的成本。
所以当时为了降低成本,我接入了商汤的 SenseNova 系列出图模型。这个模型观感还算好,但设计美感确实连 Nano Banana 都不如,只能说能看。不过最重要的是它免费,一毛钱都不要,所以我之前基本都用这套模型在生成,一张图大概三四十秒。
但我感觉最近商汤这个模型降智挺严重,图片质量大不如前,而且经常出花图——可能跟他们拿掉了 VAE 有关系。主要是这个模型现在经常降智,出的图片美感还越来越差,我其实挺痛苦的。那会儿已经用 GPT Image 2.5 生成了一半的图片了。
就这两天,Qwen Image 2.1 出现了。这个模型已经达到了初代 Nano Banana 的水准,甚至差不多接近 Nano Banana Pro 的水准,相当相当厉害。更夸张的是它竟然是开源的。我本地出 0.6MP 的草图大概 25~30 秒,2.0MP 的图片大概 2 分钟,改图的话要乘个 1.5 倍时间。虽然时间上可能并不占优势,但贵在本地就能完成。
现在基本上我本地开着 ComfyUI,智能体可以直接操作出图、出音乐、出视频、放大图片这四个功能,非常方便。越来越像一个坐在桌前、只用说话的人了。真的,AI 改变了生产力的方式。
📖 本文阅读量 加载中... 次
|
🌐 全站访问 加载中... 次