跳转至

猫猫们唱歌工具链 v7更新

更新工具链。这次更新算是微调,只是将绘图模型从Lite改用了Fast。Fast在大多数情况下画质并没有Lite好,但是在卡通场景下,效果大多数时候 Fast更好。

智能体与 LLM 模型

  • CherryStudio — 主控台,所有智能体调度
  • DeepSeek v4.1 Flash — 主力模型
  • Gemini 3.8 Flash - 重要节点参考LLM

音乐相关

  • YuE2 — 改词、改曲
  • SoulX Singer — 改音色并润色
  • Open Soren WebUI - 歌曲最后一步合成
  • 豆包录音识别 - 获得歌词准确时间,便于分镜,主要使用此渠道
  • Qwen ASR - 获得歌词准确时间,便于分镜【备用】

图片生成

  • SenseNova u1.5 Fast/Lite — 画面首帧生成/封面抽卡
  • GPT Image 2.5 — 封面最终生成,优先使用1K,降本
  • VOSR2 - 图片超分放大,对于GPT去噪效果极佳

视频生成

  • MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
  • RTX Video Processor — 2x放大(1280p,缩小到85%出1080p视频),利用RTX Video SDK开发

模型供应商

  • DeepSeek 官方
  • OpenCode Go 官方订阅
  • SenseNova 商汤官方
  • GrsAI 第三方中转站
📖 本文阅读量 加载中... | 🌐 全站访问 加载中...

评论