猫猫们唱歌工具链 v7更新
更新工具链。这次更新算是微调,只是将绘图模型从Lite改用了Fast。Fast在大多数情况下画质并没有Lite好,但是在卡通场景下,效果大多数时候 Fast更好。
智能体与 LLM 模型¶
- CherryStudio — 主控台,所有智能体调度
- DeepSeek v4.1 Flash — 主力模型
- Gemini 3.8 Flash - 重要节点参考LLM
音乐相关¶
- YuE2 — 改词、改曲
- SoulX Singer — 改音色并润色
- Open Soren WebUI - 歌曲最后一步合成
- 豆包录音识别 - 获得歌词准确时间,便于分镜,主要使用此渠道
- Qwen ASR - 获得歌词准确时间,便于分镜【备用】
图片生成¶
- SenseNova u1.5 Fast/Lite — 画面首帧生成/封面抽卡
- GPT Image 2.5 — 封面最终生成,优先使用1K,降本
- VOSR2 - 图片超分放大,对于GPT去噪效果极佳
视频生成¶
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
- RTX Video Processor — 2x放大(1280p,缩小到85%出1080p视频),利用RTX Video SDK开发
模型供应商¶
- DeepSeek 官方
- OpenCode Go 官方订阅
- SenseNova 商汤官方
- GrsAI 第三方中转站
📖 本文阅读量 加载中... 次
|
🌐 全站访问 加载中... 次