Echoo 的主要用户是口译员,以及研究口译和翻译的学者。口译员一边听一边说,视线本来就紧张,屏幕上多一行字就多占一份注意力,所以给他们看的字幕要按另一套标准设计。
调整悬浮字幕和视频字幕之前,我们系统读了一遍近年的相关研究,重点看三个问题:
- 数字、术语和专名这些“难点”,用什么方式显示最有帮助?
- 字幕本身应该怎么排:多少行、多快、显示原文还是译文?
- 研究者测量耳口时差(EVS)时,需要什么样的录音和导出格式?
本文只采用读到原文的研究,只读到摘要的在文中标为“仅摘要”。引号中的英文是论文原话。
数字:证据最一致的一项
三项研究的结果方向一致。
Desmet、Vandierendonck 和 Defrancq(2018)测的是理想条件下的上限:讲者说出数字后,助手立刻翻动幻灯片,相当于零延迟、零错误的“完美系统”。10 名学生的数字准确率从 56.5% 升到 86.5%,错误数从 400 个中的 174 个降到 54 个,作者称之为“ceiling”。
Defrancq 和 Fantinuoli(2021)换成了真实 ASR。InterpretBank 显示实时转写,数字用大号红字标出。有 ASR 时,完整译出率从 67.7% 升到 90.2%,漏译从 15.8% 降到 3.5%。
Pisani 和 Fantinuoli(2021)不显示完整转写,只把抽取出的数字和单位排成列表,最新一项在顶部。使用列表的一组数字错误率为 14.8%,对照组为 39.8%。
另有两项发现与显示方式直接相关。SmarTerp 的可用性研究(Frittella 2023,10 名从业十年以上的职业口译员)中,孤立数字的成功率只有 40%,带复杂所指对象的数字达到 90%,所以数字最好和它指的对象一起显示。屏幕上不断变化的数字则会让口译员困惑:InterpretBank 会显示中间结果,数字依次变成“three > 3 > 300 > 300000 > 300,000”;Pisani 和 Fantinuoli 的被试也被屏幕上的实时更正(2021→2027)弄糊涂过。
术语和专名
术语的证据同样正面,但样本较小。Prandi(2023)比较了三种条件:PDF 词表、手动查询工具、模拟 ASR 自动显示术语和译名。9 名学生的术语准确率分别为 78.00%、86.26% 和 96.3%,模拟 ASR 条件下 EVS 也最短。被试最常抱怨的是,预期的术语没有出现时反而更分心。
专名的证据最弱,机器处理得也最差。Gaido 等(2021)测试的语音翻译系统,人名正确率只有 37% 至 40%。SmarTerp 研究中,口译员读错了 43% 的专名,罕见专名读错的比例在 70% 至 90% 之间。目前还没有专门比较专名显示方式的对照实验。
延迟:2 秒以内,3 秒是上限
Fantinuoli 和 Montecchio(2022)把讲话中的数字替换成哔声,让 8 名学生只能看屏幕,并逐段增加显示延迟:
| 延迟 | 数字准确率 | 所指对象准确率 | 数字处不流利 |
|---|---|---|---|
| 1 秒 | 97.14% | — | 2.85% |
| 2 秒 | 97.14% | — | 5.71% |
| 3 秒 | 98.85% | 100% | 5.71% |
| 4 秒 | 93.14% | 94.28% | 25.71% |
| 5 秒 | 94.86% | 85.71% | — |
作者的结论是口译员“can cope with a system latency of 3 seconds”。这项研究的延迟按段落递增,延迟效应和练习效应混在一起。
职业口译员的要求更高。SmarTerp 采用 2 秒固定延迟,10 人中仍有 8 人认为太慢,“及时性”是满意度最低的一项。Russello 和 Carbutto(2023)的系统平均延迟为 4.2 秒,辅助效果很有限。
显示原文还是译文
直接比较这两种方式的研究只有一项。Zhang 和 Xie(2025,仅摘要)让 20 名研究生做英译中同传,只显示原文字幕的一组,在准确性、流利度和译语质量上都优于看双语机翻的一组。
Su 和 Li(2025)记录了 14 名中文母语职业口译员的视线。原文和机翻同时显示时,原文的注视时间占 38.52%,机翻只占 15.51%。译入外语时,口译员几乎不看机翻;译入中文时,看机翻越多,准确率越高。
机器译文可能只在译入母语时有帮助。两项研究的结论不完全一致,差别可能来自口译方向。
整段文稿,还是只列要点
这个问题的证据互相冲突。完整文稿能减少漏译,但会增加风格错误,也有人觉得分心:Defrancq 和 Fantinuoli 的 6 名被试中,4 人有时或经常被滚动转写分心,一半人更想只看数字。Tan 等(2025)的 4 人试点则相反,完整转写的效果好于只看术语和数字,4 人也都更喜欢完整转写。
行数方面,口译场景下没有对照实验,口译研究普遍用两行(Su 和 Li 2025)。非口译场景中,Macháček 和 Bojar(2020)的单人用户测试里,1 行窗口有 35.27% 的时间被评为“不可用”,2 行降到 11.08%;Javorský 等(2022)的 32 人研究中,5 行只比 2 行略好,差异不显著。
至于要点列表怎么排,SmarTerp 的可用性研究给出了具体建议:
- 最初版本用新项替换最旧的一项,5 名试点被试中有 4 人感到困惑。改成新项放在最上面之后,有人称之为“ideal”。
- 6 人希望重复出现的项跳回顶部,因为听到难点时,视线会先去看顶部。
- 过时的项应当淡出,保留时长最好可以设为 30 秒、1 分钟或 2 分钟。
过度依赖的风险
多项研究都记录到口译员过度依赖屏幕上的文字:
- Defrancq 和 Fantinuoli 的研究中,ASR 断流时完整译出率跌到 50%,低于完全没有辅助的水平。同一研究里,ASR 把 106 000 识别成“1 and 160 000”,两名看了屏幕的被试都照此译出。
- SmarTerp 中,工具漏掉某一项时,口译员跟着漏掉的比例在试点中为 93%,正式研究中为 60%。
- 在含数字或专名的片段中,口译员 76% 的注视时间落在字幕上,只有 21% 落在讲者面部(Yuan 和 Wang 2023)。Guo 等(2025)使用整页字幕,EVS 逐句拉长到约 12 秒,不过这项研究没有对照组。
SmarTerp 研究中,跟住讲者、不等工具的口译员表现更好。Fantinuoli(2017)和 Frittella(2023)都主张精确率优先于召回率:宁可少显示,也不要显示错。
Echoo 据此做了哪些调整
| 调整 | 依据 |
|---|---|
| 字幕默认只显示原文,双语和只看译文仍可切换 | Zhang 和 Xie 2025(仅摘要);Su 和 Li 2025 |
| 字幕中标出数字、名称和术语表里的词:只改颜色或加细下划线,不加动画 | Defrancq 和 Fantinuoli 2021;关于注意力的眼动研究 |
| 要点栏:最新的在最上面,再次出现时跳回顶部,一分钟没再出现就变淡 | Frittella 2023 |
| 数字带上后面两个词,例如“10.91 million · people have” | Frittella 2023;Fantinuoli 和 Montecchio 2022 |
| 还在识别中、可能被改写的数字暂不进入要点栏 | Defrancq 和 Fantinuoli 2021;Pisani 和 Fantinuoli 2021 |
| 术语同时显示术语表里的对应译法 | Prandi 2023;Frittella 2023 |
| 悬浮窗新增“文稿”模式,保留最近 2–6 行,默认 3 行 | Macháček 和 Bojar 2020;Javorský 等 2022 |
其中“后面两个词”是折中的做法,没有研究证明两个词最合适;“默认 3 行”也缺少口译场景下的直接证据。这两项都可以在设置里调整,也可以作为研究变量。
给研究者:耳口时差和双声道录音
EVS 的测量方式并不统一。多数研究报告的平均值在 2 至 4 秒之间,也可能出现负值(Defrancq 2015 的范围是 −1 到 10 秒)。锚点的定义各不相同:
- 源语词起点对译语词起点(Defrancq 2015;Collard 和 Defrancq 2019)
- 源语词终点对译语词起点(Ono 等 2008)
- 按句子计算句首和句尾的差(Doi 等 2021)
近年的做法是用 ASR 词级时间戳加跨语言对齐自动计算。Guo 和 Han(2024,仅摘要)报告,最佳流程与人工测量的中位误差低于 0.1 秒。
录音通常把原声和口译分轨保存。欧洲议会的视频本身就是分轨的;Chmiel 等(2017)用自研软件同步录制两路音频,再强制对齐到词级,边界误差一般在 50 毫秒以内。
Echoo 的视频字幕和悬浮字幕现在都可以打开“同时录下我的口译”。原声和口译员的麦克风进入同一个音频处理节点,按同一时钟切分,逐采样对齐。导出时,除了原有的事件日志、逐句统计和原声音频,还会多出两个文件:
| 文件 | 内容 |
|---|---|
echoo-<时间>.interpretation.wav | 口译员麦克风,16 kHz 单声道,与原声等长 |
echoo-<时间>.stereo.wav | 左声道原声、右声道口译,可以直接导入 ELAN 或 Praat |
麦克风这一路不做回声消除、降噪或自动增益,只保存在本机,不参与识别。显示原文还是译文、是否使用文稿模式、文稿行数、是否标出要点,这些显示条件都会写进事件日志的第一行,方便区分实验条件。
下一步计划支持按研究者常用的格式导出,包括 ELAN(.eaf)、Praat(TextGrid)和 EXMARaLDA(.exb),附带逐词时间戳,以及一张允许负值、可按不同锚点计算的 EVS 对照表。
口译员的声音属于个人数据。ESIC 语料库因此不分发口译音频(Macháček 等 2021),PINC 的研究也表明,仅凭声音就能识别出是哪位口译员(Koržinek 和 Chmiel 2021)。在研究中使用双声道录音,请事先取得知情同意,分享数据时使用匿名编号。
证据的局限
现有研究样本小,被试以学生为主,大多只有 4 至 27 人。职业口译员的研究只有 Frittella(10 人)、Li 和 Chmiel(23 人)、Rodríguez González 等(16 人)以及 Su 和 Li(14 人)。中英方向的研究大多测的是完整字幕,几乎没有针对要点列表的实验。完整文稿还是只列要点、显示机翻是否有益,这两个问题的结论互相冲突。有些原始报告本身前后不一,例如 SmarTerp 的延迟,书中一处写 0.2 秒,另一处写 2 秒。
Echoo 的各种显示方式都可以切换,每次会话会记录显示条件,并能按原来的时间线回放,可以用来检验这些尚无定论的问题。
参考文献
- Chmiel, A., Janikowski, P. & Lijewska, A. (2020). Multimodal processing in simultaneous interpreting with text. Target 32(1): 37–58. doi:10.1075/target.18157.chm(仅摘要)
- Chmiel, A., Szarkowska, A., Koržinek, D. et al. (2017). Ear–voice span and pauses in intra- and interlingual respeaking. Applied Psycholinguistics 38(5): 1201–1227. 作者接受稿
- Collard, C. & Defrancq, B. (2019). Predictors of ear-voice span, a corpus-based study with special reference to sex. Perspectives 27(3): 431–454. doi:10.1080/0907676X.2018.1553199
- Defrancq, B. (2015). Corpus-based research into the presumed effects of short EVS. Interpreting 17(1): 26–45. doi:10.1075/intp.17.1.02def
- Defrancq, B. & Fantinuoli, C. (2021). Automatic speech recognition in the booth. Target 33(1): 73–102. doi:10.1075/target.19166.def
- Desmet, Vandierendonck & Defrancq (2018). Simultaneous interpretation of numbers and the impact of technological support. In Fantinuoli (ed.), Interpreting and Technology, 13–27. Language Science Press. doi:10.5281/zenodo.1493291
- Doi, K., Sudoh, K. & Nakamura, S. (2021). Large-scale English-Japanese simultaneous interpretation corpus. IWSLT 2021: 226–235. ACL Anthology
- Fantinuoli, C. (2017). Speech recognition in the interpreter workstation. Translating and the Computer 39: 25–34. PDF
- Fantinuoli, C. & Montecchio, M. (2022). Defining maximum acceptable latency of AI-enhanced CAI tools. arXiv:2201.02792
- Frittella (2023). Usability research for interpreter-centred technology: The case study of SmarTerp. Language Science Press. doi:10.5281/zenodo.7376351
- Gaido, Rodríguez, Negri, Bentivogli & Turchi (2021). Is “moby dick” a whale or a bird? Named entities and terminology in speech translation. EMNLP 2021: 1707–1716. ACL Anthology
- Guo, M. & Han, L. (2024). From manual to machine: Evaluating automated ear–voice span measurement in simultaneous interpreting. Interpreting 26(1): 24–54. doi:10.1075/intp.00100.guo(仅摘要)
- Guo, Xie, Han, Lei & Li (2025). From sight to insight: live captioning in Chinese–English SI. Linguistica Antverpiensia NS–TTS 24: 160–187. PDF
- Javorský, D., Macháček, D. & Bojar, O. (2022). Continuous rating as reliable human evaluation of simultaneous speech translation. WMT 2022. arXiv:2203.02458
- Koržinek, D. & Chmiel, A. (2021). Interpreter identification in the Polish Interpreting Corpus. Revista Tradumàtica 19: 276–288. doi:10.5565/rev/tradumatica.291
- Li & Chmiel (2024). Automatic subtitles increase accuracy and decrease cognitive load in simultaneous interpreting. Interpreting 26(2): 253–281. doi:10.1075/intp.00111.li(仅摘要)
- Macháček, D. & Bojar, O. (2020). Presenting simultaneous translation in limited space. ITAT 2020, CEUR Vol-2718. PDF
- Macháček, D., Žilinec, M. & Bojar, O. (2021). Lost in interpreting: Speech translation from source or interpreter? Interspeech 2021. arXiv:2106.09343
- Ono, T., Tohyama, H. & Matsubara, S. (2008). Construction and analysis of word-level time-aligned simultaneous interpretation corpus. LREC 2008. ACL Anthology
- Pisani & Fantinuoli (2021). Measuring the impact of ASR on number rendition in SI. In Wang & Zheng (eds.), Empirical Studies of Translation and Interpreting. Routledge. doi:10.4324/9781003017400-14
- Prandi (2023). Computer-assisted simultaneous interpreting: A cognitive-experimental study on terminology. Language Science Press. Zenodo
- Rodríguez González, Saeed, Korybski, Davitti & Braun (2023). Assessing the impact of ASR on RSI performance using the NTR Model. SAY IT AGAIN 2023: 1–8. 论文集 PDF
- Russello & Carbutto (2023). The Interpreters’ Newsletter 28: 69–90. doi:10.13137/2421-714X/35551
- Su & Li (2025). Eye-tracking visual attention of professional interpreters during technology-assisted simultaneous interpreting. Linguistica Antverpiensia NS–TTS 24: 188–212. doi:10.52034/lans-tts.v24i.818
- Tan, Orăsan & Braun (2025). Pilot study on integrating ASR into remote healthcare interpreting. arXiv:2502.03381
- Yuan & Wang (2023). Cognitive processing of the extra visual layer of live captioning in simultaneous interpreting. Ampersand 11: 100131. doi:10.1016/j.amper.2023.100131
- Zhang & Xie (2025). Monolingual versus bilingual captioning. Interpreting and Society 5(2): 131–153. doi:10.1177/27523810251323943(仅摘要)