研究开场与表达节奏
分析第一句话、信息展开顺序和结尾的行动引导。时间戳可以帮助区分真正说出口的开场与仅出现在画面中的文字。
让视频中的每一句话,都能被整理和复用
想拿到 TikTok 视频里的原话,又不想一句一句反复回放?从公开视频链接或本地视频、音频开始,对照时间戳核对文字,修正措辞,再选择适合笔记、写作或字幕的格式。
文字稿记录的是视频中的语音,区别于发布文案、画面上的文字和翻译结果。
先判断是否适合你
你可能只想找一句原话,也可能需要整理笔记,或给自己的视频做字幕。先确认来源是否可用,以及你真正需要的结果。
操作流程
让视频来源、语音内容和字幕时间保持对应。在发布字幕或引用内容前,先核对转写结果。
使用公开 TikTok 视频的链接。如果链接无法读取,可以改用已有的视频或音频文件。知道语音语言时手动选择;不确定时使用自动识别。
按时间分段阅读转写内容,并与原视频核对。检查人名、专业术语和不清晰的语句。背景音乐、多人同时说话和过快语速都可能影响识别。
做笔记或写作时选择 TXT;常见剪辑字幕流程选择 SRT;网页视频字幕选择 VTT。修改句子会更新文字内容,分段的原始时间保持不变。
根据手里的来源选择入口
优先选择能用最少步骤获取语音内容的方式。只是想了解结果格式时,可以直接体验示例,不必先下载视频。
复制具体视频的链接,而不是创作者主页或搜索结果页。完整视频地址和支持的 TikTok 短链接可用于链接入口。这种方式依赖处理时原视频仍然可以访问。
自己的录制内容,或公开链接获取失败时,已有的本地副本会更方便。先确认实际格式、时长和大小。修改扩展名不会转换编码;如果只需要其中一段,可先用剪辑工具裁剪。
如果视频已经有清晰字幕,而你只需要几个字,手动核对对应位置可能就够了。需要整段口述文字、可检索的笔记或独立字幕文件时,转写更有价值。现有字幕也可能出错,关键措辞仍应对照语音确认。
理解转写结果
TikTok 文字稿是对视频中口述内容的文字记录。语音识别读取音轨,因此即使创作者没有添加字幕,也可以根据语音生成文字稿。你可以查找一句话、整理笔记或准备字幕文件,减少反复播放整段视频的次数。
让文字稿发挥作用
一份可用的文字稿,让口述信息更容易核对和整理。复用内容时,保留原视频来源。
分析第一句话、信息展开顺序和结尾的行动引导。时间戳可以帮助区分真正说出口的开场与仅出现在画面中的文字。
从口述教程中整理步骤、材料或解释。先在文字中查找细节,再回放对应位置,确认用量和操作要求。
用带时间戳的文字稿作为字幕初稿。在剪辑软件中检查措辞和每行长度;语音时间对应准确,也不代表字幕阅读速度一定合适。
将自己的录音说明整理成提纲、文章或简报。文字稿保留口述措辞,转换格式时再处理重复表达和未完成的句子。
选择合适的文件
根据下一步用途选择格式。文本文件适合阅读整理,字幕文件保留播放时需要的时间信息。
| 格式 | 包含内容 | 适合用途 |
|---|---|---|
| TXT | 纯文字,不含字幕时间码 | 笔记、提纲和文档 |
| SRT | 带序号、开始和结束时间的字幕段落 | 视频剪辑与常见字幕工作流程 |
| VTT | 带开始和结束时间的 WebVTT 字幕 | HTML 视频与网页播放器 |
复用前,先核对
清晰的语音比被音乐盖住的声音更容易识别。口音、语种切换、陌生人名和多人同时说话都可能带来错误。AI 转写适合作为初稿;引用重要内容或发布字幕前,应听一遍对应片段。
遇到问题,先找到原因
先分清是来源问题、音频问题,还是导出后的使用问题。如果生成按钮禁用且面板显示预览,说明当前环境未连接处理服务。
先自行打开链接,确认它指向仍然公开的视频。重新复制分享链接,并检查不是账号主页地址。来源仍受限时,如果你已有自己的可用副本,可以改用文件入口。
首版限制为五分钟、50 MiB。可以保留相关片段,或用剪辑工具导出较小的受支持文件。避免反复大幅压缩导致人声不清晰。分段处理录音时,记录每个片段在原文件中的起始时间。
先确认内容包含口述语音,而不是只有音乐。检查文件保留了音轨,人声也能听清。画面上的文字不属于语音,需要 OCR;语音工具无法还原从未听得到的词句。
回放相关片段并手动修正。短视频或混合语言内容尤其需要检查所选语音语言。背景音乐和长停顿可能干扰识别。删除重复文字前,先确认说话者并没有真的重复。
语音分段不一定就是合适的字幕阅读单位。可在字幕编辑器中把长句拆成较短段落,留出足够阅读时间,并配合视频预览。在面板中修改文字会保留原时间码,并不会自动重新调整字幕时间。
SRT 和 VTT 是独立文本文件,并不是已把字幕压进画面的视频。需要在兼容的播放器或剪辑软件中导入字幕文件,并选择字幕轨道。软件无法读取时,应导出它支持的格式,而不是只修改文件扩展名。
把初稿,核对成可以放心使用的文字
核对的仔细程度应与错误带来的影响相匹配。个人笔记可以先做基本检查;公开引用、操作说明和发布字幕,则需要更认真地对照原语音。
重点听否定词、数量、日期、人名和单位。把“十五”写成“五十”,或漏掉一个“不”,都可能让流畅的句子表达完全不同的意思。这只是说明核对重点的例子,并非本工具实测错误。
回放目标句子前后的一小段。笔记中保留来源链接和时间戳,方便再次核对。删减或改写内容时,把自己的概括与说话者原话区分开。
用于笔记时,检查分段并整理不必要的重复。用于字幕时,检查时间、行长,以及字幕是否遮挡重要画面信息。格式有效的字幕文件,仍可能需要编辑调整才能发布。
开始前,你可能想了解
在 TikTok 链接标签中粘贴公开视频链接,或在上传文件标签中选择视频、音频。选择语言,生成文字稿,再核对带时间戳的内容。链接处理依赖视频保持公开可访问。工具面板会显示转写服务是否可用;标注的格式示例并不是你的视频转写结果。
可以,语音转文字识别的是音轨,不需要视频已有字幕。但视频必须包含可以听清的语音。纯音乐或无声片段可能无法生成可用文字稿;画面文字需要另外使用 OCR 工具识别。
上传支持 MP4 视频和 MP3、M4A、WAV 音频,最长 5 分钟。MP4、MP3、WAV 最多 50 MiB,M4A 音频最多 8 MiB。处理服务会检查实际容器内容和时长,改名或编码不兼容的文件可能被拒绝。仅在开始转写时才会发送文件。
带时间戳的转写分段可以导出为 SRT 或 VTT;TXT 保存可读文字,不含字幕时间码。SRT 常用于剪辑流程,VTT 适合网页播放器。导入后仍需在目标播放器或剪辑软件中检查时间对应和字幕行长。
转写是把语音记录为原语言文字;翻译是将这些文字转换成另一种语言,两者是不同操作。选择英语表示识别英语语音,并不会把其他语言的音频翻译成英文。
视频可能已删除、设为私密或受到访问限制,媒体地址也可能过期。有些帖子是图片合集而非口述视频。如果你已有可用副本,上传文件可以绕过链接获取步骤,但音轨仍需包含能识别的语音。
不是。发布文案是帖子附带的文字描述和话题标签;文字稿记录音频中的口述内容;字幕再为这些口述内容添加时间信息。一个视频可以同时具备三者,而且内容可能完全不同。
准确度受录音质量、背景声、语言和表达方式影响,没有适用于所有 TikTok 视频的统一准确率。请把输出当作初稿,对照原视频修正关键措辞,并在发布前检查字幕时间。
已连接的工作台无需账号或付费。每设备每天最多 3 次尝试、每 IP 每天最多 10 次,按 UTC 日期重置,失败尝试计入额度。处理服务未连接时,仅提供明确标注的格式演示。
选择文件时保留在本地,开始转写后才会发送到 Cloudflare 私有存储和 Workers AI。访问由创建任务时的设备 Cookie 控制,不提供公开媒体链接。媒体和结果在 24 小时后过期,由后台清理。请导出需要保留的文件。
处理时间取决于来源获取、时长和当前服务负载。面板会显示真实任务状态。尚未建立有代表性的速度基准,因此样例不代表固定处理时间。
每个文件或链接视频限制为 5 分钟。更长录制内容需要先裁出相关短片段;如果后续拼接文字稿,请保留每段在原始文件中的起始时间。当前版本不提供批量处理或超过上限的视频自动拆分。
语音识别读取音频,不读取视频画面的像素。只出现在画面上的幻灯片、产品标签或无声文字,需要 OCR。如果说话者把它们读出来,语音文字稿可能会包含这些词句,但并不是独立提取了画面文字。
不会。SRT 是含时间信息的独立字幕文件。需要把它导入兼容的播放器或剪辑软件,检查分段时间;如果希望字幕固定显示在画面中,再由该软件导出视频。在这里编辑文字,不会把字幕压进视频,也不会自动修改时间码。