实时字幕如何辅助口译:研究证据与 Echoo 的设计取舍
梳理近年关于 ASR 辅助同传的实证研究:数字、术语和专名,延迟上限,原文与译文,过度依赖的风险,以及耳口时差的测量方法。并说明 Echoo 据此做了哪些调整。
适用场景
识别结果按短语实时输出,译文紧随原文上屏,无需等待整句结束,字幕与画面保持同步。
字幕位置固定,新增内容逐词淡入,模型修正仅做局部更新,整行不重排、不跳动。
本地视频在浏览器内播放,仅传输识别所需的音频,视频文件不离开你的设备。
同传模型在收听过程中会持续修正前文。Echoo 对每次更新进行逐字比对:新增内容淡入显示,修正内容高亮提示,其余文字保持不变。
原文与译文由同一连接同步返回,边说边出,无需等待整句结束。
支持原文、译文、双语三种显示模式,可随时切换。
新增内容逐词淡入,被修正的词语高亮提示,阅读不受干扰。
视频文件保留在本地,仅将音频用于识别与翻译。
源语言自动识别,目标语言涵盖中、英、日、韩、法、德、西、俄等 60 种。
导出字幕事件日志、分段统计表与音频,可按原时间线回放分析。
lecture-07-attention.mp4
英语 → 中文 · 原文 + 译文
every token scores against every other token
每一个词都会和序列里其他所有词算一次相关度
示意图。字号、行数与显示方式可在“字幕设置”中调整。
使用邮箱注册即可开始使用,每日可用时长可在账户页查看。
支持本地视频、浏览器标签页、整个屏幕与麦克风。
字幕叠加于视频画面或显示在悬浮窗口,字号与语言可随时调整。
本地视频仅在浏览器中播放,传输至服务器的只有识别所需的音频。
字幕记录与音频由浏览器直接生成并下载,不经过服务器存储。
在账户页即可注销账户,服务端保存的账户信息与用量记录将一并清除。
梳理近年关于 ASR 辅助同传的实证研究:数字、术语和专名,延迟上限,原文与译文,过度依赖的风险,以及耳口时差的测量方法。并说明 Echoo 据此做了哪些调整。