为什么翻译后的文档会变长
目录
翻译后的文档可以在不增加思想的情况下增加页数。不同的词长、句子结构、换行规则和字体度量会改变相同含义所需的空间。
简短回答
当目标文本比源文本占用更多的水平或垂直空间时,翻译后的文档就会变长。这可能是因为翻译使用了更多字符、更长的词、更少的断行位置、更宽的字符,或者更大的行距。
因此,页数是版面排布的结果,而不是衡量翻译质量的可靠指标。一份简洁的翻译可能仍需要多一页,而一份糟糕的翻译可能因为省略了内容而更短。
最实用的规划原则很简单:预期版面会发生变化,尤其是当源文件被设计成紧凑排布时。
为什么相同的含义会占用更多空间
简短的英语标签可能大幅膨胀
英语和中文通常能紧凑地表达信息。W3C 指出,因此从这些语言翻译出来的文本常常更长,尤其是当源文包含简短标签时。
它的文本膨胀指南给出了英语翻译成欧洲语言时的以下平均规划范围:
| 英语源文本长度 | 译文平均长度相对于源文本 |
|---|---|
| 不超过 10 个字符 | 200-300% |
| 11-20 个字符 | 180-200% |
| 21-30 个字符 | 160-180% |
| 31-50 个字符 | 140-160% |
| 51-70 个字符 | 151-170% |
| 超过 70 个字符 | 130% |
这些数字是版面预留空间,并不保证适用于某个具体的语言对。它们有用的教训是:最短的源字符串往往需要最大的按比例安全余量。一个两词的表格标题或提示框可能比一整段文字带来更多麻烦,因为它通常位于更小的容器内。
语法改变词数
语言打包含义的方式并不相同。一种语言可能用词形变化来表达一个概念,而另一种语言则需要冠词、介词、助动词或解释性短语。语序也可能把修饰语或条件移到会多出一行的位置。
这并不意味着译者应该照搬源文结构,或为了保持页数而删掉必要的词。翻译首先必须完整、自然;版面应当去适应它。
长词减少换行选择
W3C 用德语词 Eingabeverarbeitungsfunktionen 作为例子,说明一个复合词替代了英语短语“Input processing features”(输入处理功能)。英语短语可以在空格处换行。而德语复合词可能会留在一行里,除非文档具备合适的、能感知语言的断词功能。
Unicode 的换行标准解释了为什么这很重要:软件会根据所用字符和语言所允许的换行机会来选择断行位置。当这些机会有限时,窄栏、表格单元格和文本框会更早出现问题。
字符数不等于视觉宽度
一份翻译可以包含更少的字符,却仍然占用更多空间。W3C 将英语 desktop 与日语 デスクトップ 进行比较:日语词字符数更少,但通常需要更大的水平宽度。
字体替换可能再次改变结果。后备字体可能比源字体更宽或更高,把原本能放下的一行变成两行。如果翻译后的文件除了溢出之外,还出现缺字、字母断开或意外的字体,请用我们的指南为什么字体在翻译后会出错单独诊断这些问题。
有些文字需要更多垂直空间
阿拉伯语、中文、天城文、日语、韩语、泰语、藏语以及其他文字,可能比拉丁文字需要更高的字形或更大的行距。因此,一个段落即使行数不变,也可能增加垂直空间。
这就是为什么缩小字体很少是最佳的首选修复方法。文字也许能放下,但目标文字可能变得难以阅读,或者其符号可能相互碰撞。
文本膨胀在哪里破坏文档
长的正文段落通常会自动重排。问题集中在那些按源文本尺寸设置的容器中:
| 文档元素 | 典型故障 | 更好的应对方式 |
|---|---|---|
| 标题 | 多出的一行把正文挤到另一页 | 允许换行,并让标题与下一段保持在一起 |
| 表格 | 行变高、列变得过窄,或文字被裁切 | 加宽关键列、允许行增高,或更改页面方向 |
| 文本框和提示框 | 文字溢出或自动缩小 | 放大文本框,或只在审查含义后再缩短文字 |
| 表单 | 标签与字段碰撞 | 把标签移到字段上方,或增加标签宽度 |
| 页眉和页脚 | 文字与页码或页边距重叠 | 简化重复文字,并检查每一节 |
| 图注和脚注 | 引用与其对象分离 | 让相关元素保持在一起,并更新分页 |
| 幻灯片 | 项目符号变得密集或小到无法阅读 | 拆分幻灯片,或在翻译前精简源内容 |
一行的改变可能在整个文件中引发连锁反应。表格变高会移动图注;图注移动会改变分页;分页改变又会改变目录。应在文字定稿后再审查整个文档,而不是在措辞仍在变动时逐页修复。
翻译前准备源文件
1. 移除手动换行
为了让源文件看起来均衡而插入的换行,很少适合目标语言。保留真正的段落分隔,但让普通句子自动换行。
2. 给狭窄容器留出增长空间
翻译前检查表格、侧栏、表单、图表和文本框。只在有空间的地方增加内边距,启用行增高,并避免用固定高度的框来承载重要文字。
3. 使用段落和标题样式
样式让全局修复成为可能。如果翻译后的标题需要不同的间距或行高,一次样式更改比手动编辑每个标题更安全。
4. 设置正确的文档语言
语言设置能帮助兼容的软件选择拼写、断词和换行行为。它们还能防止编辑器把源语言的规则套用到翻译后的文字上。
5. 保护不能更改的术语
标记产品名称、代码、URL、变量和法律标识符。为译者提供缩写的上下文,而不要依赖可能没有紧凑对应形式的缩短源标签。
6. 保留可编辑的主文件
尽可能在 DOCX、PPTX、电子表格或设计源文件中修复版面。Google Cloud 的文档翻译指南建议,先把 DOCX 或 PPTX 翻译好,再把结果转换为 PDF,因为这些格式通常比 PDF 更好地保留版面和样式。关于 PDF 的专门准备,请遵循在不丢失格式的情况下翻译 PDF的工作流程。
在不损伤译文的情况下修复膨胀的翻译
按以下顺序操作,这样视觉上的修复不会造成语言问题:
- 确认没有内容被重复。 将标题顺序、列表、表格和重复段落与源文件对比。
- 移除源语言的换行。 在更改排版之前,先让目标文字重新排布。
- 调整容器大小。 加宽列、加深文本框,或允许表格行增高。
- 调整间距。 减少过多的段落间距或内边距,但不要让文字显得拥挤。
- 应用能感知语言的断词。 只有在它符合目标语言和文档风格时才使用。
- 局部改写。 请合格的审校人员在保留含义和语气的前提下缩短标题或标签。
- 最后才缩小字体。 保持正文和重复元素一致,不要为了勉强放下而只缩小孤立的段落。
不要为了恢复原来的页数而删除限定语、示例、警告或法律条件。如果必须遵守固定限制,例如一页的表单或两张幻灯片的摘要,请在翻译前就明确该限制,以便译者能针对可用空间来撰写。
使用保留版面的翻译工作流
把文字复制到普通的翻译器里,会丢弃版面所依赖的表格、样式、文本框和关系。上传可编辑的文档,能让具备文档处理能力的工具保留更多结构。
OpenL Doc Translator 支持 PDF、DOCX、PPTX、XLSX、EPUB 和 SRT 等格式。其官方页面表示,它会保留字体、颜色、表格和页面版面,并提供翻译版和双语版。双语文件有助于检查版面变化是来自合理的文本膨胀,还是来自缺失或重复的内容。
保留格式能减少手动重建,但它无法让每种语言都占用完全相同的空间。最后要用双语文档审校清单另行进行双语和版面审查。检查溢出、表格增高、分页、页眉、页脚、目录以及最终导出的 PDF。
交付前的最终检查
- 没有文字被裁切、隐藏、重叠,或自动缩小到低于批准的字号。
- 表格保持其行列关系,并且仍然可读。
- 标题与其所引出的内容保持在一起。
- 图注、脚注、提示框和页码引用仍然指向正确的位置。
- 字体支持目标语言的每一个字符和样式。
- 目录和交叉引用已更新。
- 可编辑文件和导出的 PDF 都已审查。
- 双语对照确认没有为了压缩文件而丢失内容。
翻译后的文档变长,通常说明语言和版面在相互作用,而不是哪里出了错。为膨胀预留空间,保留文档结构,并且只有在翻译完成后才调整版面。
Sources
- W3C: Text size in translation - Explains systematic text expansion, compound words, character width, line height, and flexible-layout planning.
- Unicode Standard Annex #14: Unicode Line Breaking Algorithm - Defines line-break opportunities, line fitting, and language-sensitive hyphenation considerations.
- Google Cloud: Translate documents - Explains document-format support, layout preservation, and why DOCX or PPTX sources generally retain layout better than PDF.
- OpenL Doc Translator - Lists supported formats, layout-preservation features, and bilingual review output.


