跳转至

猫猫们唱歌工具链 v6更新

更新工具链,这算是一次重大升级,首先是刚刚发布一周的DeepSeek v4.1 Flash,在质量基本不变的情况下,5-8倍的速度,让我一天就把之前一周需要整理的结构全部搞定了。价格还很便宜,仿佛回到了那个DeepSeek 0731的时代。 其次,音乐生成方面基本没有版权风险了,YuE2的出台,让音乐效果可以追平Suno 5.5,并且基本没有在X Studio那漫长的调音过程了,也不需要云端支持,彻底独立出来了。释放了依赖云端制作重要步骤的风险。我感觉这就是我最后一块拼图。 第三,是个降本增效的图片处理。GPT Image 2.5的构图能力强,写字没问题,同时1K图只需要4分钱不到。再经过10秒的VOSR2放大,效果比直出2K、4K图还好,每一期的制图成本基本压缩到了3毛以内。 第四,重用Gemini 3.8 Flash,写稿子很有特点,虽然很多方面不如其他模型,但最重要的是有特点。这和踢足球一样,基础达标后,最重要的是有特点!这一步可能每期开销要5毛左右。 第五,ASR识别改用豆包,这点纯粹属于提高效率。豆包在语音识别上明显高于千问。而且这个步骤实际支出很低,由于豆包 还送了20小时体验包,目前属于0成本。

智能体与 LLM 模型

  • CherryStudio — 主控台,所有智能体调度
  • DeepSeek v4.1 Flash — 主力模型
  • Gemini 3.8 Flash - 重要节点参考LLM

音乐相关

  • YuE2 — 改词、改曲
  • SoulX Singer — 改音色并润色
  • Open Soren WebUI - 歌曲最后一步合成
  • 豆包录音识别 - 获得歌词准确时间,便于分镜,主要使用此渠道
  • Qwen ASR - 获得歌词准确时间,便于分镜【备用】

图片生成

  • SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
  • GPT Image 2.5 — 封面最终生成,优先使用1K,降本
  • VOSR2 - 图片超分放大,对于GPT去噪效果极佳

视频生成

  • MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
  • RTX Video Processor — 2x放大(1280p,缩小到85%出1080p视频),利用RTX Video SDK开发

模型供应商

  • DeepSeek 官方
  • OpenCode Go 订阅
  • GrsAI 第三方中转站
📖 本文阅读量 加载中... | 🌐 全站访问 加载中...

评论