Go 解析邮件的三个坑:GBK 标题、QP 正文,以及 NextPart 偷偷帮你做的事

收邮件这件事,协议层(SMTP 收信)其实没多难,真正磨人的是拿到原始报文之后:标题是一串 =?GBK?B?xPq1...?=,正文是一堆 =C4=FA=B5=C4,同一封信里 HTML 和纯文本各一份,外面还可能再套一层附件。

这篇用 Go 标准库把一封"问题邮件"从原始报文解到可读文本,顺带把几个容易踩的坑讲清楚。代码是为这篇文章现写的,完整可跑,只额外依赖 golang.org/x/text 做 GBK 转码。

测试用的原始报文

先造一封国内系统很常见的验证码邮件:发件人和标题用 GBK/GB2312 编码,正文是 multipart/alternative,纯文本部分走 quoted-printable,HTML 部分走 base64。

go 复制代码
const raw = "From: =?GB2312?B?zajWqrf+zvE=?= <noreply@example.com>\r\n" +
	"To: someone@example.com\r\n" +
	"Subject: =?GBK?B?xPq1xNHp1qTC686q?= =?UTF-8?B?77yaODQ3MjAx?=\r\n" +
	"MIME-Version: 1.0\r\n" +
	"Content-Type: multipart/alternative; boundary=\"b1\"\r\n" +
	"\r\n" +
	"--b1\r\n" +
	"Content-Type: text/plain; charset=GBK\r\n" +
	"Content-Transfer-Encoding: quoted-printable\r\n" +
	"\r\n" +
	"=C4=FA=B5=C4=D1=E9=D6=A4=C2=EB=CA=C7 847201=A3=AC10 =B7=D6=D6=D3=C4=DA=D3=D0=D0=A7=A1=A3\r\n" +
	"--b1\r\n" +
	"Content-Type: text/html; charset=UTF-8\r\n" +
	"Content-Transfer-Encoding: base64\r\n" +
	"\r\n" +
	"PHA+5oKo55qE6aqM6K+B56CB5pivIDxiPjg0NzIwMTwvYj48L3A+\r\n" +
	"--b1--\r\n"

注意 Subject:前半截是 GBK,后半截是 UTF-8,两个 encoded-word 之间隔了一个空格。这不是我故意刁难,转发、代发、模板拼接之后的真实邮件里经常出现。

坑一:标题解码,mime.WordDecoder 默认不认 GBK

Go 的 mime.WordDecoder 能处理 RFC 2047 的 =?charset?B/Q?...?= 格式,但它只内置了 UTF-8、ISO-8859-1 和 US-ASCII ,遇到 GBK 直接报错。要自己给它一个 CharsetReader:

go 复制代码
func charsetReader(charset string, input io.Reader) (io.Reader, error) {
	switch strings.ToLower(charset) {
	case "utf-8", "us-ascii", "":
		return input, nil
	case "gbk", "gb2312", "gb18030":
		// GB2312 和 GBK 都是 GB18030 的子集,统一按 GB18030 解最稳
		return transform.NewReader(input, simplifiedchinese.GB18030.NewDecoder()), nil
	}
	return nil, fmt.Errorf("unsupported charset: %s", charset)
}

var dec = &mime.WordDecoder{CharsetReader: charsetReader}

func decodeHeader(s string) string {
	out, err := dec.DecodeHeader(s)
	if err != nil {
		return s // 解不了就原样返回,别让一个头拖垮整封信
	}
	return out
}

两个细节:

  1. 声明是 GB2312 的邮件,实际内容经常超出 GB2312(生僻字、全角符号),按 GB2312 严格解会出乱码或替换字符。统一按 GB18030 解,它向下兼容前两者。
  2. 用 DecodeHeader 而不是 Decode。Decode 只接受一个完整的 encoded-word,DecodeHeader 会处理混排的普通文本和多个 encoded-word,而且按 RFC 2047 的规定,相邻两个 encoded-word 之间的空白会被丢掉。所以上面那个 GBK + UTF-8 拼起来的标题能正确还原成一句话,不会中间多个空格。

坑二:multipart.Reader.NextPart 会偷偷帮你解 QP

遍历 multipart 的时候,大部分教程写的是 mr.NextPart()。它有个不太显眼的行为:如果子部分是 quoted-printable,它会自动解码,并且把 Content-Transfer-Encoding 头从 Header 里删掉。

这本来是好意,但如果你的代码后面统一根据 CTE 头做解码,就会出现两种结果:QP 部分被"自动"解了,你拿不到 CTE 头以为它是原文;base64 部分它不管,你又得自己解。行为不一致,出问题很难查。

我的建议是用 NextRawPart()(Go 1.14 起有),所有传输编码自己处理,逻辑统一:

go 复制代码
type Part struct {
	ContentType string
	Body        string
}

func walk(r io.Reader, contentType, cte string, out *[]Part) error {
	mediaType, params, err := mime.ParseMediaType(contentType)
	if err != nil {
		// Content-Type 写错的邮件并不少见,兜底当纯文本
		mediaType, params = "text/plain", map[string]string{}
	}
	if strings.HasPrefix(mediaType, "multipart/") {
		mr := multipart.NewReader(r, params["boundary"])
		for {
			p, err := mr.NextRawPart()
			if err == io.EOF {
				return nil
			}
			if err != nil {
				return err
			}
			if err := walk(p, p.Header.Get("Content-Type"), p.Header.Get("Content-Transfer-Encoding"), out); err != nil {
				return err
			}
		}
	}
	// 叶子节点:先解传输编码,再解字符集,顺序不能反
	var body io.Reader = r
	switch strings.ToLower(strings.TrimSpace(cte)) {
	case "quoted-printable":
		body = quotedprintable.NewReader(body)
	case "base64":
		body = base64Reader(body)
	}
	cr, err := charsetReader(params["charset"], body)
	if err != nil {
		return err
	}
	b, err := io.ReadAll(cr)
	if err != nil {
		return err
	}
	*out = append(*out, Part{ContentType: mediaType, Body: string(b)})
	return nil
}

递归是必须的:multipart/mixed 里套 multipart/alternative 再套 multipart/related(HTML 内嵌图片)是很常见的三层结构。

解码顺序是"先传输编码、后字符集"。传输编码(QP/base64)是为了让二进制能走 7bit 通道加的一层壳,壳里面才是某个字符集的字节流。反过来做,GBK 的字节会被当成 UTF-8 去解 QP,全乱。

坑三:base64 正文里的杂质

标准库的 base64.NewDecoder 能跳过 \r\n,但有些发信系统会在 base64 行尾留空格或 Tab,解码直接报 illegal base64 data。做个最小清洗:

go 复制代码
func base64Reader(r io.Reader) io.Reader {
	b, _ := io.ReadAll(r)
	clean := strings.Map(func(c rune) rune {
		if c == '\r' || c == '\n' || c == ' ' || c == '\t' {
			return -1
		}
		return c
	}, string(b))
	return base64.NewDecoder(base64.StdEncoding, strings.NewReader(clean))
}

这里为了简单直接 ReadAll 进内存了。附件很大的场景应该写一个流式过滤的 io.Reader,不然几十 MB 的附件会整个进内存两次。

跑起来

go 复制代码
func main() {
	msg, err := mail.ReadMessage(strings.NewReader(raw))
	if err != nil {
		panic(err)
	}
	fmt.Println("原始 Subject:", msg.Header.Get("Subject"))
	fmt.Println("解码 Subject:", decodeHeader(msg.Header.Get("Subject")))
	fmt.Println("解码 From   :", decodeHeader(msg.Header.Get("From")))

	var parts []Part
	if err := walk(msg.Body, msg.Header.Get("Content-Type"), msg.Header.Get("Content-Transfer-Encoding"), &parts); err != nil {
		panic(err)
	}
	for _, p := range parts {
		fmt.Printf("[%s] %s\n", p.ContentType, strings.TrimSpace(p.Body))
	}
}

import 部分:

go 复制代码
import (
	"encoding/base64"
	"fmt"
	"io"
	"mime"
	"mime/multipart"
	"mime/quotedprintable"
	"net/mail"
	"strings"

	"golang.org/x/text/encoding/simplifiedchinese"
	"golang.org/x/text/transform"
)

go mod init mimedemo && go get golang.org/x/text && go run .,输出:

bash 复制代码
原始 Subject: =?GBK?B?xPq1xNHp1qTC686q?= =?UTF-8?B?77yaODQ3MjAx?=
解码 Subject: 您的验证码为:847201
解码 From   : 通知服务 <noreply@example.com>
[text/plain] 您的验证码是 847201,10 分钟内有效。
[text/html] <p>您的验证码是 <b>847201</b></p>

还没覆盖的部分

这份代码能对付大多数验证码、通知类邮件,但离一个完整的邮件解析器还差几块,列出来免得误用:

  • 附件文件名 :Content-Disposition 里的 filename*= 是 RFC 2231 编码(filename*=GBK''%C4%FA...),还有超长文件名被拆成 filename*0*=、filename*1*= 的续行形式。mime.ParseMediaType 能处理 RFC 2231 续行,但字符集只认 UTF-8 和 US-ASCII,GBK 文件名要自己再转。
  • 没声明 charset 的正文 :老系统发的信经常不写 charset,上面的代码会当成 UTF-8,遇到 GBK 字节就是乱码。靠谱一点的做法是先 utf8.Valid 判断,不合法再按 GB18030 试。
  • multipart/alternative 选哪个:这里把两份都收了。实际展示时应该优先 HTML,并且 HTML 必须做消毒(去脚本、去外链追踪像素)再渲染,这是另一个话题。
  • Big5、ISO-2022-JP 等其他字符集:按同样的方式往 charsetReader 里加分支就行,golang.org/x/text/encoding/htmlindex 可以按名字直接查。

我在 forxi.cn 上做临时邮箱时,临时邮箱收到的基本就是这类验证码和通知邮件,字符集五花八门。如果你也在做收信相关的东西,建议一开始就把 GB18030 兜底和 NextRawPart 这两件事做对,后面能少查很多乱码工单。

相关推荐
子兮曰1 小时前
1.3亿月活还不够,DeepSeek这次直接把饭碗端走了
前端·后端·aigc
知守观1 小时前
我用 Executors 创建线程池,被阿里规约第一页打了脸——老项目并发踩坑实录
后端
卷无止境1 小时前
前沿部署工程师:当代码写到客户的办公室里
后端·python
lizhongxuan1 小时前
Agent Sandbox:Firecracker 运行路径与安全边界
后端
海岳云舟1 小时前
简易规则引擎 easy-rules
后端
卷无止境1 小时前
AI Agent权限管理,如何做到"敢用又稳"
后端·python
imDwAaY1 小时前
Redo Log 和 Binlog 为什么需要两阶段提交?
后端·mysql
xyLJ1 小时前
Redis 常见的数据类型及底层结构
后端
我的div丢了肿么办1 小时前
go语言中的时间time
后端·go