猫猫们唱歌工具链 v6更新
更新工具链,这算是一次重大升级,首先是刚刚发布一周的DeepSeek v4.1 Flash,在质量基本不变的情况下,5-8倍的速度,让我一天就把之前一周需要整理的结构全部搞定了。价格还很便宜,仿佛回到了那个DeepSeek 0731的时代。 其次,音乐生成方面基本没有版权风险了,YuE2的出台,让音乐效果可以追平Suno 5.5,并且基本没有在X Studio那漫长的调音过程了,也不需要云端支持,彻底独立出来了。释放了依赖云端制作重要步骤的风险。我感觉这就是我最后一块拼图。 第三,是个降本增效的图片处理。GPT Image 2.5的构图能力强,写字没问题,同时1K图只需要4分钱不到。再经过10秒的VOSR2放大,效果比直出2K、4K图还好,每一期的制图成本基本压缩到了3毛以内。 第四,重用Gemini 3.8 Flash,写稿子很有特点,虽然很多方面不如其他模型,但最重要的是有特点。这和踢足球一样,基础达标后,最重要的是有特点!这一步可能每期开销要5毛左右。 第五,ASR识别改用豆包,这点纯粹属于提高效率。豆包在语音识别上明显高于千问。而且这个步骤实际支出很低,由于豆包 还送了20小时体验包,目前属于0成本。
智能体与 LLM 模型¶
- CherryStudio — 主控台,所有智能体调度
- DeepSeek v4.1 Flash — 主力模型
- Gemini 3.8 Flash - 重要节点参考LLM
音乐相关¶
- YuE2 — 改词、改曲
- SoulX Singer — 改音色并润色
- Open Soren WebUI - 歌曲最后一步合成
- 豆包录音识别 - 获得歌词准确时间,便于分镜,主要使用此渠道
- Qwen ASR - 获得歌词准确时间,便于分镜【备用】
图片生成¶
- SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
- GPT Image 2.5 — 封面最终生成,优先使用1K,降本
- VOSR2 - 图片超分放大,对于GPT去噪效果极佳
视频生成¶
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
- RTX Video Processor — 2x放大(1280p,缩小到85%出1080p视频),利用RTX Video SDK开发
模型供应商¶
- DeepSeek 官方
- OpenCode Go 订阅
- GrsAI 第三方中转站
📖 本文阅读量 加载中... 次
|
🌐 全站访问 加载中... 次