1Step 1: 上传音频
从 MP3、WAV、FLAC、AAC、OGG 或 M4A 音频文件开始,单个最大 100MB。免费注册即送积分,也不需要手动输入歌词。
1从 MP3、WAV、FLAC、AAC、OGG 或 M4A 音频文件开始,单个最大 100MB。免费注册即送积分,也不需要手动输入歌词。
2AI 自动从音频转写文字,并逐行同步,支持 50 多种语言。渲染前可以点击任意行修正文字。文字时间跟着音频走,每一行都在被唱出或说出的那一刻落到画面上。
3发布前先预览完整歌词视频。确认歌词准确、画面匹配歌曲情绪,再导出为 16:9 YouTube、9:16 TikTok/Reels/Shorts,或 1:1 信息流格式。
手动给成片加歌词,通常要逐行打字、拖时间轴,还要反复检查歌词有没有挡住最重要的画面。LyricVideoMaker 会把视频里的音频转成节拍同步的歌词叠层,同时保留原视频的画面和节奏。
无论是 MV、现场演出、婚礼片段、旅行蒙太奇、粉丝剪辑还是宣发短片,都可以直接加上歌词层,而不是被套进通用字幕模板。

把歌词放在真正适合视频的位置,让文字清晰可读,同时避开人物表情、舞蹈动作、产品镜头和关键瞬间。
不是把文字死板地钉在画面底部,LyricVideoMaker 把同步的歌词(或字幕)当成视觉层处理,让它跟着音频出现,并在你的原画面上保持清晰可读。
如果 AI 转写结果需要修正,点击对应歌词行调整文字即可,继续沿用同步流程,不必从头重做整条视频。
在 LyricVideoMaker 里,当前“给视频加歌词”更准确地说,是先从歌曲音频生成一条以歌词为主的 MP4;直接上传已有视频并叠加歌词属于规划中的工作流。稳定路径是音频上传、AI 转写、节拍同步、场景生成、逐行编辑和导出。
输入
只接受音频上传:MP3、WAV、FLAC、AAC、OGG、M4A,单个文件最大 100MB。
歌词
AI 从人声自动转写,支持 50 多种语言自动识别,导出前每一行都能修改。
同步
按节拍和演唱节奏做逐行时间轴,不是把字幕粗暴贴到固定位置。
画面
先做分镜规划,再生成匹配歌曲情绪的 AI 场景图,歌词始终是主角。
导出
保留原始音频导出 MP4,支持 16:9、9:16、1:1,适配 YouTube、Shorts、TikTok、Reels 和信息流。
开始
免费积分起步,可以先跑完整预览,再决定要不要继续投入这首歌。
搜索这个词的人往往已经有素材。诚实的边界很简单:当前产品稳定地从音频生成新歌词视频;直接在已有视频上叠歌词,还需要更多视频控制能力。
| 判断点 | 实用建议 |
|---|---|
| 当前稳定 | 上传音频、转写歌词、同步节拍、生成场景、预览并导出 MP4。 |
| 规划叠字 | 上传已有视频,提取或匹配音频,再把歌词放到原画面上。 |
| 叠字所需 | 避开人脸的位置控制、原视频质量保持和拖拽摆放。 |
| 现在可用 | 为同一首歌生成独立歌词视频,和已有视频一起作为发行素材。 |
| 最佳检查 | 先确认歌词是否清晰可读,再考虑未来叠到具体画面的位置。 |
| 预期管理 | 今天使用音频优先结果;把直接视频叠字当成即将完善的方向。 |
渲染前可以按这些点检查,尤其是同一个项目要导出多个平台画幅时。
给视频加歌词,最好让时间来自音频而不是手动时间轴。真正重要的判断发生在渲染之前 —— 下面是值得记住的几条原则。
无论是歌词还是普通字幕,时间都来自音频本身 —— 同步文字直接嵌入,不用打字也不用拖拽,文字还会避开人脸。
歌词是观众跟着走的主线,不是最后才贴的字幕。顺序永远是先转写、再对节拍对轴、再设计画面。
AI 负责转写、对时间、生成场景;风格对不对、断句改不改、要不要竖屏方屏导出,仍由你判断。
观众不该在「读词」和「看画面」之间二选一。对比度要强、行要短、动效要克制,让画面帮歌词而不是抢戏。
第一遍看文字抓转写错误,第二遍听节奏抓提前或滞后的行,第三遍看平台适配,确保手机信息流里也读得清。
一个项目同时产出 16:9 完整版、9:16 竖屏和 1:1 方形,不用重打歌词、不用重做时间轴,多平台保持一致。
歌还在耳朵里时就做歌词视频:更快听出别扭断句、更早发现听错的词,也更容易判断哪里该加视觉能量。
导出前做一次快速复查,很多质量问题还没变成返工就能处理掉。
| 检查项 | 怎么确认 |
|---|---|
| 音频准备 | 支持 MP3、WAV、FLAC、AAC、OGG、M4A,文件保持在 100MB 以内。 |
| 语言检查 | 系统能自动识别 50 多种语言,但双语 hook 和专名仍建议人工看一遍。 |
| 时间检查 | 节拍同步会给出稳定基础;如果某句比人声早或晚,要手动微调。 |
| 画面检查 | AI 场景图要匹配情绪,同时不能让歌词变难读。 |
| 画幅检查 | 16:9、9:16、1:1 要分别看,因为每种画幅的可读字号都不同。 |
当视频已经拍好,只缺一个干净、同步的歌词层时,用同一个 AI 流程完成转写、同步、预览和导出。

给正式 MV、表演剪辑或视觉视频加上歌词,让观众跟得上歌词,同时保留原本画面。

把 live set、cover、录音室 session 或排练音频做成歌词视频,让现场能量和歌词内容同时被看见。

给 first dance、活动高光或纪念视频加上歌词,当歌曲本身就是画面情绪的一部分。

给旅行素材、配乐剪辑和社媒短片加上同步歌词,不用手动重建时间轴。