Gemini 4 发布后各路实测都在跑长任务、写代码、做 3D------没人测翻译的硬骨头:谐音梗。我拿了一批中文互联网的经典梗做了轮实测,结论先说:能翻出「字面对」,翻不出「笑点对」,但过程里藏着几个真问题。
测试集设计
挑了四类谐音梗,每类都是「直译必死」型:
- 纯谐音:「蚌埠住了」「芭比Q了」「尊嘟假嘟」
- 双关:「人生就是起起落落落落落」「工资三千,梦想三千万」
- 文化梗:「画个大饼」「内卷」「破防了」
- 结构梗:「不听不听,王八念经」这类节奏依赖型
评估标准不是「信达雅」,分三档:字面正确(至少没翻错字面)、读者可懂(目标语言读者能 get 到这是个玩笑)、笑点保真(真会笑)。
结果:字面 100%,可懂 40%,保真 8%
「蚌埠住了」翻成 "Bengbu can't hold it anymore"------字面对了,但英文读者完全不知道这是「绷不住了」的谐音。模型几乎从不主动做「谐音重建」(在目标语言里造一个等效谐音),因为那需要放弃字面忠实------而翻译训练的第一原则就是忠实。
「画个大饼」翻 "draw a big pie" 后模型会补一句注释(metaphor for empty promises)------注释党是它处理文化梗的标准姿势。能懂,但笑点死在注释里。
唯一翻出笑点的是「人生就是起起落落落落落」→ "Life is full of ups and downs and downs and downs and downs"------因为笑点在结构不在谐音,结构是可以直译的。这个发现很有意思:梗的「可翻译性」取决于笑点载体,结构梗 > 双关梗 > 纯谐音。
三个真问题(不严肃实测的严肃结论)
1. 忠实度和幽默度是互斥目标。 翻译模型被训练成「不敢发挥」,而幽默翻译的本质是再创作。这不是模型能力问题,是目标函数问题------想要梗翻得好,需要专门的「创译」(transcreation)模式,允许且鼓励偏离字面。
2. 上下文决定策略。 同一个「内卷」,在论文里该翻 involution(学术语境),在段子该翻成冗长的解释或干脆本地化成 rat race。模型单句翻译时无法知道自己在哪种语境------这也是为什么双语对照阅读时人工可以随时接管:机器给基线,人做本地化决策。
3. 梗的半衰期。 「尊嘟假嘟」这种梗的生命周期可能只有几个月,而模型的知识有截止日期。翻译「过气梗」时模型反而更从容(进了语料),翻译「进行时梗」全靠泛化。想追热梗翻译的,工具的模型更新频率比模型能力更重要。
结语
如果你也想测,推荐从结构梗入手(最容易看到模型的上限)再到纯谐音(最容易看到下限)。至于实际用途:看英文 meme 的时候,AI 能帮你懂个七成;但想把中文梗输出给外国朋友------目前还是自己动嘴最靠谱。
(实测过程用了我自己做的翻译工具跑批,工具做翻译基建,梗的本地化还是人来的。)