普通翻译交出去的是字符串,排版还可以往下长。图片里的文字不是这种对象。字已经烤进像素,框的宽和高不会因为你换成德文就自动变宽。所以这份规格先不讲「哪家最好用」,先规定:什么能当输入,什么才算合格输出,保真看哪一列,自动化停在哪一步,一轮是几秒还是几小时,费用落在免费额度、API、开源组件还是人工。
十条路都保留,编号与对照表一致。讲述顺序按输入合同和自动化程度重排:先写源文件还在时的干净路径,再写不依赖源文件的在线与文档服务,然后是识别加排版、多模态、扩散和自建脚本,最后才是「只能看懂」的手机,以及必须人做的两条手工档。海报、菜单、包装、说明书这些物料放在规格之后,用来说明同一条约束会在什么图上爆,而不是用来代替规格。
规格合同:一张图进去,必须守住的输出
输入分三档,不要混用。 第一档是已经压平的位图,常见 PNG 或 JPEG。活动海报、菜单、商品主图、信息图、漫画格、包装照片都属于这一档。你拿到的往往只有导出的图,没有设计师的工程。第二档是扫描件或 PDF。文字可能还在可复制的文本层里,也可能整页都是图像,两种要分开测,不能看到扩展名是 PDF 就以为文字可编辑。第三档是尚未压平的源文件,例如 Photoshop 的 PSD、Illustrator 的 AI、InDesign 文档。第三档还在时,最干净的做法是直接改文本框。一旦被人导出成合并图层的图,问题会退回到识别加排版,图层、效果和字距都不再是可编辑对象。
输出也分三档。 同位图:分辨率与输入一致,只换文字区域,背景和其余元素尽量留在原位。可编辑工程:PSD、AI,或仍带文本框的 PDF,图层和效果还在,方便下一轮改字号。屏幕叠字:手机里实时盖一层译文,用来看懂,不能当成品发布。保真高的方法追求前两档。手机相机翻译明确停在第三档。把第三档的截图交去印刷,等于把「看懂」误当成「可发布」。
评价用固定字段,不用一句「效果不错」。 保真指译后的图与原设计有多接近,不是译文的语言分数,也不是 BLEU。识别指 OCR 或模型把字读出来的能力;纯人工的方法这一列写不适用。多语言覆盖分任意、很多、非常多三档,任意表示不挑语种但靠人,非常多表示服务或模型覆盖面宽。难度指操作者要会设计、会写脚本,还是上传即用。费用分人工、服务费、API、开源、客户端免费,本文不编造单价,也不把免费写成质量最高。速度分实时、快、中、慢、很慢,秒和分钟写在每张规格卡里,不写进一个含糊的「很快」。适合谁写成物料类型:品牌与印刷、文档与图表、批量 PDF、电商漫画菜单、只阅读、信息图与海报、创意、私有自动化、法务与活动、手里有源文件。自动化单独写,因为「高自动化」里面既有上传即生成,也有脚本能批量但字体仍要人盯。
中间四件事同时成立,才算把设计留住。
字数会胀,也会缩。德文、法文相对英文,通常变长约 30% 或更多。中文、日文通常变短。版面格子是固定的,不会像文字处理器那样把下一段顶下去。译文塞不进原框时,只能改字号、换行、字距或断行。变短同样算事故:一行英文收成几个汉字之后,原来的视觉重量没了,标题会发空,按钮里的字会漂在左上角。预算要在生成前就有。大约三成的长度差,不是某一个模型的偶发缺陷,而是语种和固定格子之间的结构性冲突。
字体和样式必须对齐到规格,而不是对齐到「看起来有字」。要复现的包括字体、字重、颜色、字距,以及阴影、描边。没有同一款字体时,很难完全对齐。译文在语言上是对的,字体发飘,放在原稿旁边仍然像另一张设计。
背景必须重建。擦掉原文字会毁掉底下的像素。纯色底几乎只是填一块颜色。照片、渐变、纹理则是在补一块本来被字挡住的图像。补得不好,会出现色块、发糊或一条接缝。在线生成和扩散模型把力气主要花在这里;自建脚本若只用邻域平均或一块平涂,接缝会留下来。
非文字元素要一起算进范围。箭头、引出线、编号、图例经常自己带字,或者指向某段字。只替换正文、留下旧编号,局部像是译了,整张图的说明关系是断的。技术示意图和信息图在这一条上最容易翻车。
这些约束会落在具体物料上,但物料不能反过来定义方法。一张英文活动海报要出德文,一张日文菜单要给不会日文的人看,一张包装上的英文卖点要改成中文,一张西班牙文技术示意图要换成别的语言。文档翻译可以把段落下推。图里的字不行。你改的是像素,设计师留好的格子在旁边看着。字体差一点、背景补不齐、译文长出大约三成,都会立刻被看出来。先把输入输出写清,再决定这张图该进哪一条流水线。
对照表:十种方法的保真、识别、语言、难度、费用、速度
下表十行、八列,一行一种方法。强弱方向不要读反:手机应用保真最低;人工设计和专业人工加 DTP 保真最高;源文件直接改也在最高档。在线 AI、OCR 加排版、文档服务、多模态编辑的保真是「高」,不是「最高」。扩散模型是中高。自建 Python 流水线是中。费用一列里,低不等于好。开源和手机便宜,人工最贵。速度一列里,实时只属于手机,快属于在线 AI 和文档服务,很慢属于专业 DTP。
| 方法 | 保真 | 识别 | 多语言 | 难度 | 费用 | 速度 | 适合谁 |
|---|---|---|---|---|---|---|---|
| 1 人工设计软件 | 很高 | 不适用(人工) | 任意 | 高(要设计师) | 人工成本最高 | 慢(手工) | 高规格品牌与营销物料 |
| 2 OCR 加排版 | 高 | 高(结构化文字) | 很多 | 中高(软件或脚本) | 低(开源) | 中 | 技术文档、带标注的示意图、结构化图表 |
| 3 文档翻译服务 | 高 | 高(专业 OCR) | 非常多 | 低(交钥匙) | 中高(服务费) | 快 | 批量 PDF、扫描件、专业文档 |
| 4 在线 AI 工具 | 高 | 高(AI) | 很多 | 低(交钥匙) | 低到中(免费额度加付费) | 快 | 电商海报、漫画、日常多图本地化 |
| 5 手机相机应用 | 低 | 中高(手持拍摄) | 很多 | 很低(交钥匙) | 低(免费) | 实时 | 旅行和日常,只为看懂 |
| 6 多模态大模型编辑 | 高 | 高(模型) | 非常多 | 低(交钥匙) | 中高(API 费用) | 中 | 信息图、广告海报、需要快速推理的界面截图 |
| 7 扩散模型 | 中高 | 中(需要蒙版) | 很多 | 中(要写提示) | 中(API 或算力) | 中 | 创意设计,能接受轻微风格偏移 |
| 8 自建 Python 流水线 | 中 | 中(看工具) | 很多 | 高(要编程) | 低(开源) | 灵活(可批量) | 企业定制、批量、自动化环境 |
| 9 专业人工加 DTP | 很高 | 不适用(人工) | 任意 | 很高(专家团队) | 费用最高 | 很慢(手工) | 高端出版物,文字和格式都很严 |
| 10 直接改源文件 | 很高 | 高(来自源文件) | 很多 | 中(设计软件) | 已有软件则低 | 中 | 手里有可编辑源文件,如 InDesign 手册 |
保真在这里指译图和原设计有多接近。手机应用为了让人看懂,往往会盖一块比较粗的遮罩,再用默认字体把译文叠上去,所以保真低,即使识别能到中高。人工设计和文档类流程保住版式与字体的能力更强,但文档服务在表里的保真档是「高」:它强在坐标和格式的映射,误差主要仍来自译文长短。不要把方法 3 说成高于方法 1 或方法 9。也不要因为方法 4、方法 5 带免费额度,就把它们写成综合最优。免费是费用档,不是保真档。
对照表的读法:时间、费用、自动化不要串档
把十行收成六条可执行的判断。规格卡再展开工具名和失败模式。这里先把「选哪一档」说死,避免后面被故事带着跑。
没有源文件,又想快。这是最常见的一档。看方法 4。难度低,速度是几秒到一分钟,费用是免费额度加上超出后的付费或积分,保真是高,不是像素级承诺,也不是无损。电商主图、本地化广告、社交图、菜单、传单、漫画,日常多半落在这里。
图里字多、结构清楚,例如图表标注、技术手册、教学示意图。看方法 2。识别高,开源这一侧费用低,但时间要拆开:OCR 加翻译只要几秒到几分钟,后面的排版还要几分钟到几十分钟。批量 PDF 或扫描件改走方法 3。60 页 PDF 大约是几分钟量级,要付费或 API 额度。手写和怪版式弱。文档级保真原文给出的量级是 90% 以上。这是坐标和格式映射的描述,不是「不会出错」的保证,误差主要仍来自译文长度。
要拿去印刷,或者品牌不能跑。看方法 1 或方法 9。两者保真都是很高。方法 1 慢,贵,一张专业修改从几分钟到几小时,没有同一款字体就很难完全对齐。方法 9 时间和费用都是最高档,换来的是译者加排版一起盯文化和版式。
要嵌进自己的流程,并能批量。看方法 6 或方法 8。方法 6 一张图几秒到几十秒,费用在 API 或订阅,保真高,但会漏字、拼错,译文长度差太大时要返工。方法 8 单张运行大约几秒,软件费用走开源,开发成本高。背景常是平涂或邻域平均,不如扩散模型自然。
只是看懂一张拍到的菜单、路牌或说明书。看方法 5。几秒,实时,保真低,可能带水印或遮罩。输出是阅读辅助,不是可发布文件。
源文件还在。看方法 10。这是最干净的一条:图层和效果都还在。已经压平的图不要硬套这条,会退回方法 2。
再对一下容易看串的三列。费用:低费用是开源 OCR、自建脚本和手机应用,不是质量冠军;最高费用在人工,不在 API。速度:实时只属于方法 5;快属于方法 3 和方法 4;很慢属于方法 9;方法 1 是慢。自动化不会写进表的最后一列,但可以先记一笔:方法 3、4、5、6 接近交钥匙;方法 2、7、8、10 中间有一步必须人做或必须写脚本;方法 1 和 9 是人工从头到尾。交钥匙不等于保真更高。方法 5 最自动,保真最低。
十张规格卡:每条都写清输入、输出、自动化和失败点
每条都按同一组字段写:输入与输出、流水线、自动化、保真、时间与费用、适合谁、失败时退到哪里。编号仍是方法 1 到方法 10,方便回到表里对列。顺序改成按输入合同,而不是按「从手工讲到自动」的故事。
方法 10:源文件还在时,直接在设计环境里换字
输入通常是可编辑文档或 PDF,不是一张已经合并图层的 JPEG。输出是在原文件里换掉文字。图层、效果、主样式还在,所以这是十条里输入最干净的一档。工具侧常见 Adobe Acrobat 的 OCR 再导出到 Word、Illustrator 的查找替换、InDesign 脚本,以及第三方插件,例如 Lokalise,或 Transifex 的 InDesign 插件。另一条旁路是把图转成 PDF,做 OCR 翻译,再导回设计环境。旁路已经掺进识别,保真要单独再看,不能和「文本框还在」混成同一种输出。
流水线不必先画蒙版再重绘。能从文本框里取出字符串,就翻译,再写回同一个文本框。样式、描边和投影如果挂在样式表上,会跟着走。自动化是中等,取决于软件本身的脚本和插件,不是无人值守。替换之后仍然要人做微调。德文变长、中文变短时,文本框会溢出,或者显得空。溢出不是翻译质量问题,是框的几何问题。
保真很高,因为改的是源,不是在栅格上仿一个看起来像的字。前提是原文件真的还在,而且文字仍是文本对象,不是被设计师转曲成了路径。若对方只给了压平图,识别还得靠 OCR,行为就接近方法 2,不要再指望图层级控制。转曲后的字甚至连方法 10 的「查找替换」都点不中,只能当图形擦掉重做,那时候更接近方法 1。
时间和费用都是中等。软件如果团队已经有,边际费用低,表上写的就是「已有软件则低」。没有 InDesign 或 Illustrator 时,软件本身要另计,本文不编造授权价格。适合手里有设计源的项目,例如一本用 InDesign 排好的手册,或一套仍可打开的品牌模板。应急时也可以先做一轮粗糙的 OCR 翻译,再回到源文件里精修。干净来自「文件还在」,不来自模型更聪明。文件不在,就不要在方案评审里把方法 10 写成可选项。
方法 4:在线 AI,位图进、同位图出、中间一步生成
输入是普通位图,PNG 或 JPEG。输出是同分辨率位图,译文按原来的风格画回去。不要求 PSD,也不要求你会蒙版。流水线被收成一次操作:上传原图,自动做文字区域的 OCR,自动给出译文并允许人工改,模型擦掉原文并按相近的字体风格重画,然后下载。OCR、机器翻译和图像补全捆在同一次生成里。你不是先导出一份 TXT,再另开一个设计软件从零摆字。
代表实现包括 ReWords AI 翻译图片里的文字、ImageGPT、EditTextImage、Codia、VisualGPT。界面上通常可以锁定不该改的行,例如品牌名、已经校对过的型号,也可以改掉机器给出的那一行译文。锁定的含义是:这一行的像素不要被重绘。它解决的是「品牌被误译」,不是「整张图绝对不变」。
自动化高。上传之后点生成,检测、翻译、擦除、重绘由服务完成。人不消失。译文,尤其是数字和专名,仍要看一遍。密度很高的菜单、促销里的百分比、成分表里的单位,都是这一眼要看的对象。
保真整体是高。现一代生成模型在字体风格和背景纹理上,可以做到看不出明显涂改。这不是像素级保证,也不是无损声明。字很密、光照复杂、装饰字体很夸张时,重建会失手:笔画粘连、阴影方向不对、底纹出现一块平斑。OCR 跟原图质量走。模糊、反光、艺术字都会掉字。机器翻译是神经模型,质量会漂,值得人看,不能因为按钮叫「生成」就跳过校对。
时间是几秒到一分钟。多数不需要本地安装,对不写代码的人也友好。费用是低到中。常见有免费额度,批量则要付费或积分。以 ReWords AI 这一类产品来说,是每张图若干次免费生成,超出后走付费或积分。不是无限免费。不要把试用额度写成可以不限量铺全店商品图。
它适合没有设计源、又要把图直接本地化的日常工作:电商商品图、本地化广告和社交图、菜单、传单、漫画。两个例子要按原文记住,不要换成别的句子。包装上的 SUMMER SALE 换成「夏季特卖」,背景保持不变。另一例是 EditTextImage 把 "Summer sale --- 30% off everything" 换成德文 "Sommer-Sale --- 30 % auf alles",版式不动。这是本地化,不是风格重绘。德文这句本身就是长度变化的标本:英文促销句和德文促销句要挤在同一条横幅里,百分号和数字还得留对。
边界写进规格,而不是写进售后。质量依赖模型,有时要重试,或把某一行改短后再生成。版权和敏感内容要单独处理。未授权的成片、未公开的包装、含个人数据的截图,不要丢进公开服务再当成品。这一条和保真无关,是数据能不能离开内网的约束。内网不能出图时,方法 4 直接不合格,改看方法 8 或方法 1。
方法 3:按文档来做的保格式翻译服务
输入是扫描件、图像或 PDF,常见 JPG、PNG、PDF。输出是同格式的翻译件,版式、表格和图形位置基本还在。图像本体通常不动,动的是被解析出来的文字块。这和「整图重绘」不是同一条管道。它的步骤是:解析版式,识别文本框坐标和字体,翻译每个文字块,云端或本地机器翻译都可以,再按版式重排,输出文件。
工具例子包括 PDFTranslator,其引擎侧会用到 Gemini 与 ChatGPT 一类模型;还有 Pangeanic ECO、Pairaphrase、Smartcat。不少服务接受 PDF 或图像,输出保持原样式的翻译 PDF 或图形。选服务时要看它吃的是带文本层的 PDF,还是纯扫描。纯扫描会先掉进 OCR,识别错误会原样排进漂亮的版式里,看起来更像「正式文件」,其实更危险。
自动化高。系统端到端跑完,人主要做轻量校对。保真是高。进阶服务用高精度 OCR,加上专用的大模型或翻译系统,把文字和格式映射到坐标级。版式和字体被保住。文档级保真,原文写的是 90% 以上。请把这个数字理解成版式映射的量级,不是语言零误差,也不是每一像素都不动。误差主要来自译文长短。手写、非常规版式支持弱。一张手写菜单、一份版式很怪的海报,不要默认能进这条。
速度在多数任务上是秒到分钟。60 页 PDF 大约几分钟。费用不是开源那一档,通常是付费服务,或事先买好的 API 额度。批量或长文档会花钱。具体标价随供应商变,本文不编。适合企业里必须保住版式的多语技术文档、产品手册、培训材料、财务报告。财务报告尤其要盯数字和小数点,版式对了、数字错了,比版式错了更严重。
底下其实仍是 OCR、翻译、自动排版。PDF 翻译工具大体都是这个逻辑:解析文档结构,按区域翻译,再原位替换并保住版式。把同一套分块识别、分块翻译用在图上,得到的也是原位结果。方法 3 和方法 2 是亲缘。差别在谁做最后那一下排版,以及你要不要自己管字体。方法 3 把排版封装进服务,所以难度低、费用变成服务费、速度变快。你失去的是对单个字母字距的手控。
方法 2:OCR 取出文字盒,再在设计软件里排回去
输入仍是 PNG、JPEG 等位图。输出是一张新图。中间可以夹一份矢量文档,PDF 或 AI,用来把框的位置保住,而不是在像素上目测。流水线四步:OCR 识别,翻译,版式重建,输出图像。
识别可以用 Tesseract、EasyOCR,或 Adobe Acrobat 的 OCR。翻译可以接 Google Translate、DeepL、Baidu Translate。排版落在 Adobe InDesign、Photoshop,或编程环境里的 Pillow。也有人用 Matplotlib 把文字画回去,那更适合示意,不适合品牌物料。Tesseract 这类引擎只负责把字和位置拿出来,不负责把设计感还回去。EasyOCR 在弯曲或密集文本上有时更顺手,但字体匹配仍然不在它的输出里。
自动化是中等。OCR 和翻译可以自动。最后的排版通常还要人手,尤其源语言和目标语言长度差得大,必须改字号和行距。保真是高:字体和框的位置对上时,版式守得住。译文变长会撑破原来的空间分布,需要缩放或重排。复杂图形上的定位误差会直接掉保真。字距和连字上的细小差别也会漏进来。一个字母的框对了,连字的形状仍可能不像原字体。它不处理非文字元素。引出线和编号要另做手工。如果你的图主要是「箭头加编号」,方法 2 的自动化收益会被这一截手工吃掉。
时间必须拆开报,不能合成一个「很快」。OCR 加翻译是几秒到几分钟。后续排版是几分钟到几十分钟。字少的信息图可能靠近下限,满页标注的手册靠近上限,甚至更久。费用相对专业设计是低的。开源组件可以撑起识别和绘制。字体授权和人的时间另计。适合字多、设计要求又高的图:图表标注、技术手册、教学示意图。
Atlas Cloud 指出过一个容易被跳过的断点。OCR 把字提取出来之后,仍然要把字放回设计。纯图像编辑则是把改动合并到新的栅格图层上,对单个字母的控制更弱。手工排版更慢,但是这一档里更精确的做法。方法 2 就卡在这个断点上:前半自动,后半仍是排版。评审进度时,不要用 OCR 的秒数当作整单的交付时间。
方法 6:多模态模型,一张图加一句指令
输入是图像加自然语言提示。输出是一张新图。分辨率多为原图,或调用时指定的尺寸。模型把文字检测、语义理解和图像生成捆在一起。你要求翻译文字、设计不要变,它改字,并尽量留下版式元素和风格。流水线是:图加指令进去,模型识别并翻译,生成新图,人来校对。没有单独的「导出字符串再导回」这一步,所以中间结果不容易做版本对比。要审计的话,得把提示、原图和输出图一起存档。
工具包括带图像能力的 OpenAI ChatGPT,文中以 GPT-4V 为代表,以及 DALL·E 3 的图像编辑 API、Google Imagen Editor。Google Imagen Editor 更多还在研究阶段,不能按已产品化的按钮来规划工期。开发者也可以走 OpenAI API。这里的 DALL·E 编辑能力和后面的扩散蒙版路线有重叠,但方法 6 的入口是「看懂图再听指令」,不是你先交一张手绘蒙版。你失去蒙版,也就失去「只改这一块」的硬边界。提示里写「其它都不要改」,只是指令,不是蒙版那种像素合同。
自动化高。一句提示就能跑。保真总体上高,版式关系和风格留得比较好。原文记录的例子,是把咖啡机说明图译成西班牙文,并保住版式。Atlas Cloud 则报告 GPT-4V 翻译信息图里的文字,其余部分不动。仍然会漏掉一些字,或出现小的位移。译文长度和原文差太大时,后续修补是预期内的,不是例外。拼写错误、没译完的碎片、合成痕迹,都要人眼。它还不能替代精细排版,但在多数营销场景里能用。
一张图的生成时间是几秒到几十秒。费用是中高,来自 API 或订阅,再加上写提示和审结果的时间。控制力有限。适合快速本地化信息图、海报、带插图的宣传物料,也适合需要模型先看懂结构的界面截图。例如把一张英文广告图交给 ChatGPT,提示写成「把所有文字译成中文,其它都不要改」,模型给出对应语言的图。原文另有一组示意:左侧是韩文输入,右侧是模型输出的越南文。那是效果示意,不是可下载附件,这里不配图,也不把它当成你自己任务的验收样张。
失败时的退路要事先写好。漏了几行,就把提示改具体,或把图裁成小块重跑。长度差到版式崩了,不要在同一提示上无限重试,退回方法 2 或方法 1 修那几行。计费按图像尺寸和生成次数走,重试是有成本的。
方法 7:扩散模型,蒙版加提示,再补全
输入是三件套:原图、文字区域蒙版、一段提示。输出是图像文件。模型会尝试匹配目标语言和风格,但匹配质量取决于提示和蒙版,不是自动合同。流程是:检测文字并生成蒙版,设计提示,例如把某句换成另一句且背景不要变,然后用 DALL·E 3 或 Stable Diffusion 的 Inpainting 去填,得到新图。也可以把原图和文字蒙版交给 OpenAI 的 API,再发一条替换文字的编辑请求。
工具包括 OpenAI 的 DALL·E 3 编辑 API、Adobe Firefly 的 Generative Fill,以及 HuggingFace Diffusers 里的一类权重,例如 runwayml/stable-diffusion-inpainting。ControlNet 的文字检测和 LaMa 补全,可以用来标出要替换的区域,或先把字擦干净再交给扩散模型。DALL·E 与 DALL·E 3 都在这条路线里:前者是这类编辑能力的产品名,后者是原文点名的编辑 API。Adobe Firefly 的 Generative Fill 则是设计软件里的补全入口,蒙版往往是你用选区拉出来的,自动化因此下降半档。
自动化是中高。生成本身可以一次完成。蒙版多半要额外工具,手绘或程序生成。蒙版画大了,背景和相邻图形会被重画;画小了,原文字的边会残留。这一步的时间经常比生成本身更不稳定。保真是高里偏低的一档,表上写中高,略低于专门做文字编辑的模型。扩散模型对长文字常常不精确,会把词拆断,或在中间插入不存在的字符。风格是否稳定,看提示写得好不好。强项是背景修复。复杂纹理上可以把译文融进去,这是平涂脚本做不到的。弱项是字形有时不完整、轻微发糊,或冒出不想要的细节。要结果稳定,得调蒙版和提示,不能只调一次种子就当流程完成。
单张大约十几秒到几十秒。本地则看 GPU。云上还要加排队。费用是中等,来自 API 或算力。本文不写具体单价,也不把本地显卡的电费折成报价。适合创意向的翻译:概念图、插图里的口号,以及能接受轻微风格偏移的场合。风格可以漂一点的活动视觉,用它说得通。要跟品牌手册里的字重完全一致的包装,用它就勉强。
原文例子仍是那句英文横幅 "Summer sale --- 30% off everything"。Stable Diffusion 把它重画成德文 "Sommer-Sale --- 30 % auf alles",背景保持不变。在线 AI 那条也用过这句德文,机制不同。这里是扩散补全,不是「检测文字行、允许锁行」的产品流程。长句子在这条上更容易断词。若横幅上还有第二行小字,先假设它可能被漏掉,再去看图,而不是假设提示里的「全部」已经生效。
方法 8:自建视觉脚本,检测、翻译、擦除、重画都在自己这边
输入是普通位图。输出是同分辨率位图。没有现成图形界面。整条流水线自建,或写成脚本。步骤固定为五段:检测文字区域,可以用 OpenCV 的边缘或轮廓,也可以用一个深度 OCR 模型;按框做 OCR 并调用机器翻译;把文字区域的背景挖掉,用补全算法填上;把新字画上去;输出。每一段都可以单独打日志,这是它相对方法 6 的工程优点:中间的字符串能被人工抽检,不必等整张图生成完才发现型号被译错。
工具栈以 Python 为主:Pillow、OpenCV、EasyOCR、pytesseract,再加 Baidu Translate 或 Google Translate 的 API。原文也把 Adobe PixelSense,以及 C# 或 .NET 的图像处理,列在同类自建路线里。语言不重要,重要的是你拥有检测框、译文和绘制参数。翻译若走非官方库,只能当示例。生产更合理的是有配额、有错误码、能重试的正式 API。
脚本一旦写稳,自动化高,可以批量,适合夜里跑几千张简单标签。保真取决于算法细节,表上是中。版式可以大致对齐。字体通常不能自动匹配同一款,只能人工选一个最接近的。背景也不如扩散模型自然。常见填法是平涂,或邻域平均。复杂背景和非标准字体是短板。邻域平均在纯色上几乎看不出来,在头发、木纹、渐变按钮上会糊成一块。
运行时间大约每张几秒,看 OCR 和绘制,不是看你写脚本的那一周。开发成本高,要会编程,还要会看失败样本。相对第三方按次服务,开源组件的软件费用低。编码、调参和返工才是主要成本。不要写成零成本,也不要写成无限免费。适合有特殊流程的企业内部环境,或小规模的简单标签替换。例如商家写一段脚本,对商品图上的标签做 OCR、翻译、写回。数据不能出公网时,这条比公开的在线生成更说得通。设计细节的保真落后于专用 AI,需要调参和事后修正。它换来的是可控和可批量,不是更高的保真。
方法 5:手机相机翻译,实时,但输出规格是「看懂」
输入是手机拍摄的照片,或导入的图片、截图。输出通常是屏幕上的叠字,或一张带译文的快照。有的能保存一张标注过的图。流程很短:拍照或导入,自动 OCR,自动翻译,在原文上叠字或做标记,给人看。工具包括 Google Translate 应用、Baidu Translate 的相机模式、Microsoft Translator,以及 WeChat 内置的扫一扫翻译。
自动化是全自动。不用先把字打出来。操作难度很低,表上是很低。保真是十条里最低的一档。目标是看懂。译文用默认字体,背景遮罩比较粗,原版式和样式基本不保留。识别和翻译的语言质量可以接近专业工具,尤其是印刷体、光线正常的时候。产物仍然不能当作可发布的设计文件。识别中高和保真低可以同时成立,这是这一行最容易被读反的地方。
时间极低。实时,通常几秒。费用低,客户端多为免费。免费不提高保真。优点是快,不用专业技能,旅行和日常够用。缺点要写进规格:它不能保住原设计,可能加上标志或水印,输出只供对照阅读,不能当最终发布。用 Baidu Translate 拍文字再保存时,经常会看到工具自己的品牌标记,或一块挡住局部的补丁。那块补丁就是保真被主动牺牲的证据。
适合很快看懂外语菜单、路牌、说明书。不适合上架商品图,不适合交印厂,不适合放进品牌手册。如果你的验收标准里有「字体一致」或「不能有第三方水印」,方法 5 在进门时就可以排除,不必再比速度。
方法 1:设计师在 Photoshop、Illustrator 里手工换字
输入是任意图像,PNG 或 JPEG 都可以,源文件当然更好。输出是同格式的新图,或者带图层的 PSD、AI,方便再改一轮。人先把原文抽出来,用 OCR 或手打,翻译并校对,再在 Photoshop、Illustrator 或同类工具里,用匹配的字体和样式,把译文打在原文字区域上。流水线是:抽字,翻译和校对,找到或重做匹配的字体,擦掉原文,放入译文,调整效果。
工具是 Adobe Photoshop、Illustrator、InDesign、GIMP、Figma。Tesseract 可以协助抽字,但决定保真的是后面的手工。Figma 更常出现在界面原型,而不是印刷专色;GIMP 能完成擦除和重绘,字体库和色彩管理要自己管。自动化低。只有抽字这一段能自动。其余每一步都是人在看格子。
保真是最高档。设计师完全控制字体、位置和样式,可以把原设计尽量做回去。这取决于手艺,而且慢,并且对译文变长敏感。没有同一款字体,就很难完全对齐。不要把「最高档」写成像素级保证或无损替换。理论上可以做到看不出换过。实际上受字体、长度和背景限制。背景是复杂照片时,设计师也是在用仿制或填充修,不是把被字挡住的原始像素变回来。那些像素在导出时就已经没了。
时间高。按复杂度,一次专业修改从几分钟到几小时。几个词的纯色标题靠近几分钟。满版多语言包装、还要修阴影和烫金效果的,会到几小时。软件有学习曲线。批量时效率差,因为每一张的字体和长度都要重新看。费用是人工里很高的一档。优点是版式和风格可以按品牌要求守住,适合要求高的营销和品牌文案。缺点是慢、贵、容易在疲劳时看漏一个字母。适合广告海报、包装、界面原型,以及要高保真本地化的印刷品。
Atlas Cloud 的那句提醒在这里同样有效:字被识别出来,只是材料;放回设计,才是工作量。方法 1 把「放回去」全部交给人,所以保真上限高,吞吐低。
方法 9:译者加 DTP,保真最高,时间和费用也最高
这条不是再买一个模型,而是把活交给翻译和设计一起做。译者先处理文字,桌面排版设计师再对照原稿逐步替换。步骤包括:找到并编辑源文件,常见是 PSD 或 InDesign,翻译,在同一套软件里调版并重新输出。没有源文件时,DTP 也会退回到在位图上重修,工期会更长,因为连字体都要先鉴定。
工具通常是 Adobe 套件、InDesign、Illustrator。供应商可能用 CAT 工具保持术语一致,例如 Trados、MemoQ。术语库能保证「同一个零件名不会一页一个译法」,但最终看起来怎么样,仍取决于设计软件里的那一版。CAT 不负责把德文塞进按钮。输入可以是任何图像或源文件。输出通常是高质量的本地化图像,或仍可编辑的文件。
自动化低。每一步都有人。保真最高。译者和设计师可以按文化语境改写法,同时精确保住或调整设计。质量由专业流程兜住,而不是由一次生成兜住。文化和版式是两个人的责任,这是它和方法 1 的组织差别。方法 1 常常是设计师顺便处理译文。方法 9 是翻译质量有人签,版式有人签。
时间和费用都是最高档。翻译费加设计时间,通常远高于机器方案。适合高价值或非常敏感的内容。优点是质量和可靠性在十条的顶上。缺点是成本和周期也在顶上。适合品牌战役、大型展会物料、政府或法律文件里的图像内容,以及必须人工校对的本地化出版物。展会开幕日不能滑,法律文本不能有一个数字漂掉,这时候最贵的一档是在买责任,不是在买速度。
方法 1 和方法 9 的保真都是「很高」。不要为了表上这一档就默认外发。没有品牌或法律风险、也没有印刷公差时,方法 4 或方法 10 的规格往往已经够。有风险时,也不要用方法 4 的一分钟结果直接上机,最多把它当预览,终稿仍走方法 9。
三条端到端教程:先脚本,再接口,再在线生成
对照表解决选哪一档。下面三条把输入输出落到能跟着做的步骤上。顺序按可检查程度重排,不按产品介绍的顺序。先是本机脚本,输入文件和坐标都看得见。再是带蒙版的编辑接口。最后是不装软件的在线流程。三条都保留原教程的例子。代码里的 # 注释留在代码块中,不拿出来当标题。
教程 3:Tesseract 识别西班牙文,Pillow 擦掉再画
这条对应方法 8 的最小形态。目标是把一张含西班牙文的图译成英文。识别用 Tesseract,翻译示例用 googletrans,擦除和重画用 Pillow。OpenCV 在生产里更适合做轮廓级的精确挖字。教程为了短,先把擦除写成一个已知矩形,用来把输入输出跑通,而不是用来证明保真。
流程:读入原图,Tesseract 做 OCR,调用翻译,用绘制接口清掉原文字区域,用 Pillow 把译文画上去,写出结果图。示例输出文件名是 translated_image.png。
先装依赖。系统侧需要 Tesseract 本体。下面是 Ubuntu 上的例子。Python 侧使用教程里的库。googletrans 固定在 4.0.0-rc1 这个示例版本上。它不是官方长期支持的接口,只能用来演示「识别之后把字符串送去翻译」。
# 安装 Tesseract(以 Ubuntu 为例)
sudo apt-get install tesseract-ocr
# 安装 Python 库
pip install pytesseract pillow googletrans==4.0.0-rc1
脚本如下。识别语言是西班牙文,参数 lang='spa'。翻译方向是西班牙语到英语,src='es',dest='en'。示例只处理一个已知区域。生产里应按 OCR 的盒子动态取区域,并测量字符串宽度,决定要不要换行。
from PIL import Image, ImageDraw, ImageFont
import pytesseract
from googletrans import Translator
# 读入原图
image = Image.open("image_with_text.png")
# 做 OCR,识别西班牙文
text = pytesseract.image_to_string(image, lang='spa')
print("Recognized text:", text)
# 翻译
translator = Translator()
result = translator.translate(text, src='es', dest='en')
print("Translation:", result.text)
# 本例文字位置已知;生产环境应用 pytesseract.image_to_boxes
# 按字符取盒子,而不是写死一个矩形
x, y, w, h = 50, 50, 300, 50 # 示例坐标
# 擦掉原文字
draw = ImageDraw.Draw(image)
draw.rectangle(((x, y), (x + w, y + h)), fill="white") # 用白色盖住
# 画上译文
font = ImageFont.truetype("arial.ttf", size=36)
draw.text((x, y), result.text, font=font, fill="black")
# 保存
image.save("translated_image.png")
脚本先用 Tesseract 读出原文,再用 googletrans 取译文,然后用 Pillow 把该区域盖住并写上英文。跑完得到 translated_image.png。原文字区域被英文替换。示例坐标是 x, y, w, h = 50, 50, 300, 50。它只说明盒子从哪一像素开始、宽 300、高 50,不是一张真实海报的测量值。字体文件用了 arial.ttf,字号 36,填充黑色。这些都是为了能画出来。它们不保证和原图字体一致,这也是方法 8 保真停在「中」的原因。
白色矩形对应方法 8 的背景弱点。纯色底上,平涂可以交差。照片或渐变上,这块白会变成一块补丁,观感接近手机遮罩,只是你自己画的。实践里用 OpenCV 轮廓把挖空做准,再用更好的补全,而不是永远 fill="white"。多行文字就按段循环,每一段各自的盒子、各自的换行。整条可以批量,但版式保真落后于 AI 补全。要拿样本试,并准备调坐标、字号和填充色。若西班牙文识别成了乱码,先检查 Tesseract 是否装了对应语言数据,再谈翻译。翻译无法修复识别阶段丢掉的字母。
教程 1:用蒙版把 Summer sale 换成「夏季特卖」
这条对应多模态或扩散编辑接口的调用形态。例子是把英文 Summer sale 译成「夏季特卖」。准备三样:可用的 API 密钥,一张带字的样图,一张与样图对齐的蒙版。文件名按教程固定为 orig.png 和 mask.png。输出看 output.png。
流程:原图进去,调用 GPT-4V 或 DALL·E 的编辑端点,模型识别并翻译蒙版里的文字,生成新图,下载后校对。蒙版是这条教程的核心输入。没有蒙版,就退化成方法 6 那种全图指令,范围不可控。
第一步,orig.png 和 mask.png 必须像素对齐。蒙版只盖住 Summer sale 那一块,不要盖住不该改的装饰、价格或品牌。蒙版多盖一圈背景通常无妨,多盖到相邻文字就会把不该译的行一起重画。第二步按教程里的 OpenAI Python SDK 形态调用。下面这段用来表达「图、蒙版、提示词进,一张图出」。官方 SDK 的字段名会变,响应里也不一定直接带可写的图像字节。接到真实密钥时,以当时的接口文档为准。不要把示例字段当成永远有效的合同,也不要在没核对响应结构时直接写盘。
import openai
openai.api_key = "YOUR_API_KEY"
# 要求模型把蒙版区域里的文字译成中文
# 其余内容保持不动
response = openai.Image.create_edit(
image=open("orig.png", "rb"),
mask=open("mask.png", "rb"),
prompt="用中文翻译上面的文字,不改变其他内容。",
n=1,
size="1024x768"
)
# 把返回的图像写入磁盘
with open("output.png", "wb") as f:
f.write(response['data'][0]['image'])
提示词是「用中文翻译上面的文字,不改变其他内容。」n=1 表示要一张结果。size="1024x768" 是调用里的尺寸参数,不是说原图必须是这个尺寸,也不是质量等级的承诺。第三步检查 output.png。预期是 Summer sale 被换成「夏季特卖」,字体风格接近,背景仍是原来的背景。若中文被画成了拼音,或背景纹理被抹平,这一张就不算通过,要改提示或收紧蒙版再生成。原文另用一组示意说明多模态翻译:左侧韩文,右侧越南文。那是效果描述,不是本例的 orig.png,不要把两种例子叠成同一次调用。第四步留下 output.png。位置或字重仍有偏差时,进图像编辑器微调。这一步已经是方法 1 的一小段,算在工时里。
校对不能省。GPT-4V 生成的字会漏、会错。缺了就改提示,把要译的词写进提示里,或把文字拆成更小的块再译。OpenAI 的图像接口按图像尺寸和生成次数计费。具体价格以账户当时的费率为准,这里不写死数字。重试三次和成功一次,在账单上不是同一件事。
教程 2:在线工具,上传、改行、锁定、生成、下载
这条对应方法 4,不装软件,也没有蒙版文件。例子用 ReWords AI 走一遍。同类站点如 EditTextImage 是同一形态:检测行、改译文、再重画。流程分六拍:上传原图,系统 OCR 并检测文字,自动翻译并给出建议行,你改文字,锁住必须保留的部分,AI 渲染新图,最后下载。
第一步,打开站点,选择翻译图中文字的功能,上传要译的图。本例是一张含有 SUMMER SALE 的广告。可以从 上传并翻译图片里的文字 进入这类流程。输入规格就是这一张位图,不要求 orig.png 加 mask.png 这种配对文件。第二步,平台检测每一行。你选目标语言,例如中文。它按行返回建议。译错的行改掉。不该变的词锁住,例如品牌名。锁定要在生成前做。生成后再发现品牌被改掉,就得重跑,并消耗一次额度。第三步,点生成或应用。AI 去掉原文,按原来的字体、颜色和背景把译文重画。第四步下载。本例左侧是原来的 SUMMER SALE,右侧是生成后的「夏季特卖」。这里只描述这个对照,不附截图,也不假设你本地有样张文件。
费用再写一次,避免和速度混在一起。这类工具通常有免费额度。ReWords AI 包含每张图若干次免费生成。超出后付费,或使用积分。不是无限次。翻译质量可以很高,仍然要核对文字,尤其是数字和专名。SUMMER SALE 这种短句容易看对。「30%」若被改成别的数字,短句再漂亮也不能用。拿不到设计源、又必须直接改图时,用这条。拿到了源文件,就回到方法 10,不要为了少打开一个设计软件而把可编辑文本框栅格化。
三条教程的验收可以并列着看。教程 3 验收的是:西班牙文被识别出来,英文被画进 50, 50, 300, 50 这个盒子,文件名为 translated_image.png,背景允许是白的。教程 1 验收的是:蒙版内的 Summer sale 变成「夏季特卖」,蒙版外尽量不动,结果在 output.png。教程 2 验收的是:SUMMER SALE 变成「夏季特卖」,不该改的行仍被锁住,下载的是一张同位图。三条的通过标准不同。不要用教程 3 的白底去要求教程 2,也不要用教程 2 的锁行能力去要求一段五十行的脚本。
按约束选方法,而不是按口号选
把表和规格卡收成六条。每条只匹配一种约束。本文不排名,不说谁是第一,也不把免费档写成默认最优。
没有源文件,又想快。这是常见情况。用在线 AI,也就是方法 4。例如 没有源文件时翻译图片里的文字。上传,选语言,需要的话改行、锁行,生成,下载。时间预期是几秒到一分钟。预算里留一次校对和可能的重试。
图多字、结构清楚。图表、手册、示意图用方法 2。批量扫描件和 PDF 用方法 3。方法 2 的人时在排版。方法 3 的费用在服务或 API 额度。60 页量级先走方法 3 做速度评估,抽几页出来看 90% 以上那种版式保真是否盖得住你的表格和脚注。盖不住的页,退给方法 2 或方法 1。
结果要上印刷,品牌不能出错。用方法 1 或方法 9。方法 1 是几分钟到几小时的设计师时间。方法 9 是翻译加 DTP,时间和费用都最高。印刷公差、专色、出血,都不在生成模型的输出规格里。
要放进自己的自动化。用方法 6 的多模态 API,或方法 8 的自建 Python。前者少写代码,多付 API,一张图几秒到几十秒,准备处理漏字和长度返工。后者开发重,单张运行大约几秒,数据可以留在内网,背景多为平涂或邻域平均。若风格可以轻微偏移、又愿意做蒙版,方法 7 可以插在创意物料上,大约十几秒到几十秒,长文字要防断词。方法 7 不是印刷档的默认。
只是看懂一张快照。用方法 5。几秒,可能有水印或遮罩。不要拿去发布。
源文件还在手里。用方法 10。这是可用时最干净的一条。压平之后不要假装还在这条上,退回方法 2。
三条教程和这六条是对齐的。教程 2 服务「没有源文件又想快」。教程 3 服务自建自动化的最小闭环。教程 1 服务「有接口、要蒙版」的编辑。方法 6 若不用蒙版,就不要拿教程 1 的通过标准去卡它。
保住版式的五条硬约束
不管走哪一条,下面五条把「字译了」和「图还能用」分开。它们是约束,不是风格偏好。每条都可以在验收单上打勾。
第一条,给长度留预算。德文和法文通常变长,幅度约 30% 或更多。中文和日文通常变短。要准备改字号、重排换行或收字距。不要假设译文刚好落进原来的盒子。变长会溢出箭头和按钮。变短会让标题失去重量。格子是固定的。预算要在生成前就有。促销横幅 "Summer sale --- 30% off everything" 换成 "Sommer-Sale --- 30 % auf alles" 时,先看横幅的剩余宽度,再决定字号,而不是生成完才发现百分号被挤到下一行。中文「夏季特卖」比 SUMMER SALE 短,短了以后左右留白要不要保持居中,也是长度预算的一部分,不是审美讨论。
第二条,对齐的是字体规格,不是只对齐词。字重、颜色、字距、描边或阴影都要复现。没有同一款字体时,方法 1 也很难完全对齐。方法 8 通常只能挑一个接近的家族,教程里的 Arial 就是这种妥协。完美的译文配错字体,看起来仍然是错的。品牌手册里如果规定了字体,方法 10 和方法 1 能执行这条,方法 5 不能,方法 7 只能「看起来接近」。
第三条,背景要重建干净。字底下的修补区和周围应难以区分。边缘要羽化,在 1:1 下看接缝。纯色可以用平涂。照片、渐变、纹理不能用一块白矩形交差。教程 3 里的白色矩形是教学示例,不是印刷标准。扩散模型和方法 4 的强项在背景,但密字和复杂光照仍会失手。失手的表现是一块光泽不对的皮肤、一条方向不对的木纹,或按钮渐变被抹平。看到这些,就局部重做,不要整图加锐化来掩盖。
第四条,非文字元素一并处理。箭头、标注、编号、图例常常带着字,或指向字。只换正文,会让「见图 2」指向旧语言的说明,或让箭头还指着没被替换的英文。方法 2 明确不自动处理这些,要留人工。方法 6 相对擅长保住箭头和图例的视觉关系,但仍要检查漏译。咖啡机说明图、信息图正是这一条的典型样本。译完正文却留下原语言的步骤编号,整张图不可用。
第五条,校对译文本身。机器翻译快,但不完整。数字、单位、品牌名、专名在发布前要人看。促销信息里译错一个数字,比字体差一点更严重。锁定品牌名是方法 4 的产品能力,不是可以跳过校对的理由。专名包括人名、地名、系列名、法规编号。单位包括货币、毫克、英寸。这些在 OCR 阶段就可能被读成近似字符,翻译会把错误变得更顺,更难被扫一眼发现。
交付前还要单独看的失败模式
规格表容易让人觉得选对行就结束。交付还要看四类和「方法编号」正交的问题。它们不会因为你选了保真最高的一行就自动消失,也不会因为你选了最快的一行就变得不重要。
漏字和错字。方法 6 会漏,会拼错。方法 7 的长文字容易断词。方法 4 在装饰字体上会重建失败。方法 2 和教程 3 会在 OCR 阶段就丢字,后面的翻译只是把残句译顺。处理方式是缩小文字块重跑,或退回方法 1 只修那一行,而不是整张重做。重做整张会把已经对的背景再次破坏。
长度差导致的返工。这不是某一个模型的缺陷。德文、法文变长约 30% 或更多,中文、日文变短,格子又是固定的。差太大时,方法 6 要返工,方法 2 要改字号和行距,方法 10 要调文本框,方法 7 可能直接把单词拆开。没有任何一条因为自动化高就可以忽略这三成。验收时用「溢出、重叠、异常留白」三样去看,比用主观的「还行」可靠。
版权和敏感内容。在线生成,以及方法 6、方法 7 的云端接口,会把图像送到服务端。未授权物料、含个人数据或未公开的包装,先确认能不能出网。不能出网时,方法 8 的私有脚本或方法 1 的本地设计软件更符合约束。这不是把自建脚本写成质量更高,只是数据边界不同。方法 9 若外包,同样要把文件交给外部的人,保密协议是费用的一部分,不是技术细节。
计费边界。免费额度、按次或积分、API 额度、人工时,是四种不同的费用规格。方法 4 有免费额度,批量就要付费或积分。方法 3 和方法 6 是中高费用。方法 5 客户端费用低,但产物规格不合格,省下的钱会在不能发布时变成返工。方法 1 的人工已经很高。方法 9 最高。方法 8 的开源费用低,开发时间高。不要把某一档的免费试用写成无限免费,也不要为了省钱把手机叠字交去印刷。也不要在没有报价单的情况下写死某一家的月费。费率会变,规格不变的是「哪一档要付钱,哪一档付钱也买不到保真」。
把这些放在一起,结论可以收成验收顺序,而不是口号。没有原设计文件,仍然可以翻译图里的字。你要先选定保真档,再选方法。日常的菜单、海报、商品图、社交图,多数落在方法 4:读字,翻译,原位重画,几秒到一分钟,版式尽量不动,免费额度用完就按次或积分。赌注变高、图变复杂时,方法 1、方法 3、方法 9 仍然有位置。源文件还在,就不要绕远,直接走方法 10。只是看懂,方法 5 够用,到此为止。要自动化且数据不能出网,走方法 8,接受中等保真和平涂背景。要创意、能接受风格轻微偏移,走方法 7,并准备蒙版和断词检查。
若你手头已经有一张拖了很久的图,先按方法 4 的规格走一轮预览:上传,看行级译文,锁住不该改的品牌和数字,生成后再用五条硬约束检查长度、字体、背景、箭头和专名。这一轮只用来观察一分钟量级的结果能守住多少设计,再决定要不要升级到人工或 DTP。ReWords AI 是这条在线规格里被点名的实现之一,和 ImageGPT、EditTextImage、Codia、VisualGPT 放在同一档比较,比较的是输入输出和保真档,不是名次。预览通过,就可以交付。预览在字体或背景上失败,就把失败的那几行交给方法 1,而不是从零开始怀疑整条技术路线。