豆包九宫格验证码识别

一、简介

上图是抖音九宫格验证码图片的样例图片。这款验证码确实有很大的难度,有一下几个特点:

1、首先是图片种类非常多。

2、其次图片都是由AI随机生成,每一张图片都不一样。

3、还需要结合语义进行理解

二、识别准备

经过我们几个月的研究,终于完成了这款识别模型的开发,正确率能达到90%以上,并且我们还会持续更新,争取达到100%的正确率。

识别这个图片需要上传两个东西:

1、九宫格原图

目前不支持截图,原图是通过图片链接下载的图片,是这种直接拼接的图片,不像页面显示的有变色间隔。

2、点击描述文本

描述文本页面上显示的是什么,就需要传什么。不能修改,不能自定义描述,也不能去掉原本的标点符号。

三、识别代码

下面是使用python写的识别样例代码

python 复制代码
import base64
import requests
import datetime
from io import BytesIO
from PIL import Image, ImageDraw

t1 = datetime.datetime.now()

#PIL图片保存为base64编码
def PIL_base64(img, coding='utf-8'):
    img_format = img.format
    if img_format == None:
        img_format = 'JPEG'

    format_str = 'JPEG'
    if 'png' == img_format.lower():
        format_str = 'PNG'
    if 'gif' == img_format.lower():
        format_str = 'gif'

    if img.mode == "P":
        img = img.convert('RGB')
    if img.mode == "RGBA":
        format_str = 'PNG'
        img_format = 'PNG'

    output_buffer = BytesIO()
    # img.save(output_buffer, format=format_str)
    img.save(output_buffer, quality=100, format=format_str)
    byte_data = output_buffer.getvalue()
    base64_str = 'data:image/' + img_format.lower() + ';base64,' + base64.b64encode(byte_data).decode(coding)
    # base64_str = base64.b64encode(byte_data).decode(coding)

    return base64_str

# 加载图片
img1 = Image.open(r'E:\Python\lixin_project\OpenAPI接口测试\test_img\86.jpg')
# 图片转base64
img1_base64 = PIL_base64(img1)

得塔云地址
http://bq1gpmr8.xiaomy.net(电信)
http://220.167.181.200:9009(移动、电信、联通)
根据不同网络选择不同接口

# 验证码识别接口
url = "http://bq1gpmr8.xiaomy.net/openapi/verify_code_identify/"
data = {
    # 用户的key
    "key":"2zLW3AnTbYJaEV4ofH3G",
    # 验证码类型
    "verify_idf_id":"86",
    # 样例图片
    "img_base64":img1_base64,
    # 点击的物品名称
    "words": "有哪些生态元素可以在森林中看到?",
}
header = {"Content-Type": "application/json"}

# 发送请求调用接口
response = requests.post(url=url, json=data, headers=header)
point_list = eval(response.json()['data']['res_str'])
# 获取响应数据,识别结果
print(response.text)
print("耗时:", datetime.datetime.now() - t1)

img1 = img1.convert("RGB")
draw = ImageDraw.Draw(img1)
point_list = [(x[0] - 5, x[1] - 5, x[0] + 5, x[1] + 5) for x in point_list]
for point in point_list:
    draw.ellipse(point, fill=(255, 0, 0))
# 显示识别后标记的点击点
img1.show()

运行上面代码,用红色圆点标注出了需要点击的图片,如下图

想了解更多验证码识别请访问:得塔云

相关推荐
码农刚子1 天前
告别影楼和付费 App,5 分钟本地搭一个证件照自由平台|HivisionIDPhotos 开箱实测
python·图像识别
k4m7v2pz2 天前
豆包 Mac 客户端云电脑模式异常:AI 输出停止后回复中的 1.md 被全局替换为 shtu
人工智能·云电脑·豆包·文本替换·mac客户端·现象记录
Python大数据分析@7 天前
推荐一个好用的爬虫CLI工具
爬虫·网络爬虫
DS随心转小程序7 天前
Gemini只能导出了一部分Word文档,很少的一部分,不是我这个窗口所有的对话内容?
开发语言·人工智能·c#·word·豆包·deepseek·ai导出鸭
电商API_180079052478 天前
自动化获取淘宝评论数据技术分享之API调用示例
大数据·运维·人工智能·自动化·网络爬虫
tang777898 天前
高并发爬虫场景下,代理IP带宽优化与请求重试机制的最佳实践
网络爬虫·爬虫代理·代理ip·爬虫技巧·高并发爬虫·爬虫优化
xiezhr8 天前
现在的豆包跟以前不一样了
人工智能·ai·agent·ai agent·豆包
vivo互联网技术8 天前
VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
计算机视觉·图像识别
DS随心转小程序10 天前
AI pdf 数字化文档落地攻略,靠 AI 导出鸭补齐转换短板,从痛点到实测详解智能化文档导出逻辑
人工智能·豆包·deepseek·ai导出鸭
AI导出鸭PC端12 天前
告别复制乱码:从「秘塔怎么复制表格」到「AI 导出鸭」的专业解法
人工智能·豆包·ai导出鸭