自媒体人实测:让 AI 自己生成视频素材的 2 种姿势(附 4 个坑)
前言
本文围绕「自媒体人实测:让 AI 自己生成视频素材的 2 种姿势」这一主题,基于作者的本地实操环境整理而成,所有命令与结论均经真机验证。
阅读建议:时间有限的读者可直接跳至「问题/坑」相关章节查看结论;希望完整复现的读者建议按章节顺序阅读。
自媒体人实测:让 AI 自己生成视频素材的 2 种姿势(附 4 个坑)
我这个小号从 73 粉起号,做的是「agent 自动化运维」方向。今天不聊涨粉,聊一件更实在的事:
我让本地 AI 自己产出了一套视频素材——参考图、成片、配音、BGM,四件套,全程我没打开任何一个剪辑软件。
不是吹牛。最近一次实测中跑通的,图还压在我 Mac 里没删。下面两条路都给你看,坑也一并写上,我自己踩的。
一、两种姿势,一条路
两样东西,都是 MiniMax 官方出的,指向同一套多模态能力——只是「调用姿势」不一样:
| 路线 | 形态 | 怎么理解 |
|---|---|---|
| MMX-CLI | 命令行工具 | agent 直接「敲命令」生成 |
| MiniMax-MCP Server | MCP 协议服务 | agent 通过「协议」调工具 |
一句话:CLI 是让 agent 自己打字,MCP 是给 agent 装上一排现成按钮。 能力是同一套:文生图、图生视频、文生视频、识图、配音、音乐。
但说实话——我一开始想「到底选哪个,是不是二选一?」后来发现,两个可以一起用,接 MCP 让 agent 在聊天里调,敲命令那套留给自动化脚本。
二、CLI 这条路,40 分钟跑完
最快跑通的一条,最近一次实测中跑完整流程,耗时约 40 分钟。
装 CLI 并登录
npm install -g mmx-cli
mmx auth login --api-key 你的key
这一步很简单,跳到下一步之前先看一眼账户余额,我之前没看,跑到一半没钱才回来补,坑。
查余额
mmx quota show
文生图(做视频首帧)
mmx image generate --prompt "..." --aspect-ratio 16:9 --out-dir 参考图
prompt 我最后是用英文写的——中文 prompt 总觉得差点意思,可能是我 prompt 水平问题,不是工具问题。
图生视频
mmx video generate --image 参考图.jpg --download 成片.mp4
配音 + BGM
mmx speech synthesize --text "..." --out 配音.mp3
mmx music generate --prompt "..." --instrumental --out bgm.mp3
上面
mmx image generate跑出的实际成图(无字版):
三、MCP 这条路,聊着天让 agent 干
你想要的是「聊天里说『帮我生成一张科技感封面』,它自己就跑去生成」——这就接 MCP。
{"mcpServers": {"minimax": {
"command": ".venv-minimax-mcp/bin/minimax-mcp",
"env": {
"MINIMAX_API_KEY": "你的key",
"MINIMAX_API_HOST": "api.minimaxi.com",
"MINIMAX_MCP_BASE_PATH": "minimax-output",
"MINIMAX_API_RESOURCE_MODE": "local"
}
}}}
接上后,MCP Server 会暴露 9 个工具:
本机实测注册的 9 个工具:
1. text_to_audio 6. query_video_generation 2. list_voices 7. text_to_image 3. voice_clone 8. music_generation 4. play_audio 9. voice_design 5. generate_video
共 9 个工具,挑你用得上的。
四、4 个我替你踩过的坑
问题 1:中文「无文字」压不住英文乱码。
我文生图时写「无文字」,结果出来 TOPIC CELECTION 这种错拼标签,图片直接报废——讽刺的是,本来是想做「无文字」版的。
后来逐条否定四个词才压住:无任何文字、无字母、无标签、无标题。一个一个加进 prompt,试到第 3 次才稳。
看图就知道了,左边是乱码版,右边是无字版——对比来看是真机截图?答案是,左边那个。
问题 2:MCP 的两个官方实现版本打架。
官方 Python 版 minimax-mcp 声明依赖 mcp>=1.6.0,但 pip 默认装到 2.x。2.x 把 fastmcp 路径移除了,启动直接报 ModuleNotFoundError。
在该问题上耗时近 1 小时——先以为是依赖没装,后来以为是路径错了,最后才发现是版本问题。强约束 mcp<2.0.0 就好。
问题 3:BGM 生成比想象中慢。
首次 60 秒超时被杀。我看着屏幕上转圈圈,等了 60 秒——没了。
音乐生成就是慢,给 180 秒 + 超时 + 重试一次就好。不是失败,是我过于急躁。
问题 4:len(tools.tools) 返回 0,但 for t in tools.tools 能打印 9 个名字。
这个最离谱。我一开始写的探测脚本看起来正常——for t in tools.tools 能打印 9 个工具名,但 len(tools.tools) 却输出 0。
当时我反复运行,以为是缓存问题,多次 await list_tools()——都 0。
后来翻 MCP SDK 源码才搞明白:await list_tools() 后,ListToolsResult.tools 第二次访问会 move-out(像 Rust 那种所有权)。
解法:取到本地变量——tool_list = list(result.tools),后面只用它。这个坑最该避,因为我当初以为是 BUG,几乎要向官方仓库提 issue。
五、谁适合,谁不建议
- 适合:想让本地 agent / 脚本自动产出图视频素材的自媒体人、独立开发者。
- 不适合:只想在网页/App 里点按钮、完全不想碰终端的零基础用户——这类还是用官方 App 更省事,不建议 CLI 这套受罪。
总结
本文完整记录了「自媒体人实测:让 AI 自己生成视频素材的 2 种姿势」过程中的关键问题与对应解法。
参考资料
- MiniMax MCP Server 官方仓库
- MiniMax CLI 官方文档
- Model Context Protocol SDK 源码
写在最后
文中提到的命令与脚本均在作者本地环境实测通过,不同环境可能需要调整路径或版本约束。
觉得本文有用?欢迎收藏、评论与关注博主。作者持续整理「agent 自动化运维」方向的实测笔记。
评论区也可以留言你遇到的相关问题,作者会选取高频问题单独成文。
更多推荐




所有评论(0)