【MiniCPM-V】win10本地部署OCR等性能测试

性能尝试

本地配置如下

clike 复制代码

+---------------------------------------------------------------------------------------+
| NVIDIA-SMI 546.80                 Driver Version: 546.80       CUDA Version: 12.3     |
|-----------------------------------------+----------------------+----------------------+
| GPU  Name                     TCC/WDDM  | Bus-Id        Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |         Memory-Usage | GPU-Util  Compute M. |
|                                         |                      |               MIG M. |
|=========================================+======================+======================|
|   0  NVIDIA GeForce RTX 3080 ...  WDDM  | 00000000:01:00.0 Off |                  N/A |
| N/A   52C    P0              43W / 140W |      0MiB / 16384MiB |      0%      Default |
|                                         |                      |                  N/A |
+-----------------------------------------+----------------------+----------------------+

+---------------------------------------------------------------------------------------+
| Processes:                                                                            |
|  GPU   GI   CI        PID   Type   Process name                            GPU Memory |
|        ID   ID                                                             Usage      |
|=======================================================================================|
|  No running processes found                                                           |
+---------------------------------------------------------------------------------------+

1. Response time latency（普遍推理时间在1-2min内不等）

2. OCR理解能力，找图片试一下，多模态图片

3. 作为llm的语义理解能力

案例一：柱状图

案例二：中文发票 -> json格式

{

"发票类型": "上海市服务业、娱、贸文化体育统一发票",

"发票号码": "23100127006108438658",

"开票日期": "2012/10/11",

"供应商信息": {

"名称": "上海师范学校专科附属小学",

"税务登记号": "3101011325090797"

},

"购买方信息": {

"名称": "上海市保安服务总公司黄浦区",

"税务登记号": "3101011325090798"

},

"项目信息": {

"项目名称": "项目服务",

"项目单价": "700.00",

"数量": "6",

"金额": "4200.00",

"税率": "6%",

"税额": "126.00",

"合计": "4200.00"

},

"其他信息": {

"税款登记号": "3101011325090799",

"收款人姓名": "余周",

"付款人姓名": "李明"

}

}

案例三：英文机票 -> json格式

{

"title": "E-Boarding Pass",

"notice": "You may proceed directly to the boarding gate using this e-boarding pass. You can download and share this e-boarding pass with other guests in your booking.",

"airlines": [

{

"logo": "AirAsia",（难）

"destination": "Macao International Airport",（错）（缺少出发地）

"flight_no": "FD 776",

"date": "14 Mar 2024",

"time": "10:10"

}

],

"booking_details": {

"flight_no": "FD 776",

"departure_date": "14 Mar 2024",

"departure_time": "10:10",

"seat": "19E",

"sequence": "8"

},

"qr_code": "包含在条形码和二维码内的信息",

"status": "ASA"

}

案例四：ppt -> 根据这个图片写一段演讲稿

尊敬的各位来宾，今天我非常荣幸能够在这里与大家分享我们的内容赋能解决方案。随着信息化时代的到来，我们面临着如何充分利用数据资源来推动业务发展的挑战。在这个过程中，基于非结构化数据的分析和管理显得尤为重要。

我们深入研究了现有的企业业务系统，并针对其中的关键业务系统进行了优化。OA、ERP等系统通过内容采集的方式，将文档的文本和内容转换成可供分析的形式，从而实现对业务数据的精准理解和决策支持。

此外，我们还专注于内容处理服务的流程自动化和业务数据贯通，为企业提供了更高效的工作流程和数据共享能力。而在内容分析数据这一核心环节，我们采用了先进的数据分析技术，挖掘出隐藏在海量数据背后的宝贵信息。

为了更好地管理和运营这些内容，我们建立了内容管理体系架构，包括图谱标签、内容总线和内容数据湖等模块。这不仅有助于组织和检索内容，还能提高内容的价值和利用率。

最后，我们还提供了电子档案管理、合同管理、SAP智能内容管理等功能，以满足不同行业和业务需求的个性化服务。

总结来说，我们的内容赋能解决方案旨在帮助企业将非结构化数据转化为有价值的业务资产，提升业务效率和竞争力。感谢大家的聆听。

案例五：食物链描述（有几个动物错误，但人也难以辨认，基本正确）

<User>: 用语言描述这个食物链

<Assistant>: 这个食物链展示了一个典型的草原生态系统，包括草、树木、各种草食动物和捕食者。草是食物链的基础，为像长颈鹿、斑马、羚羊等动物提供营养。这些动物被描绘为不同的种类，它们通过吃草或其他植物来维持生命。食草动物之间存在竞争关系，但也可以共存，因为每个物种有自己偏好的植被类型。

<User>: 描述每一个动物之间的关系

<Assistant>: 根据食物链的图表，狮子是食肉动物，猎杀斑马和长颈鹿以获取食物。豹子也捕食猎物，包括猎鸟和羚羊。野猪可能会吃植物或其他小动物，而狗可能会捕食小型哺乳动物或食用人类提供的食物。鸟类，如鹰，可能捕食小型哺乳动物或其他鸟类。狐狸可能捕食小型哺乳动物或觅食垃圾。鼠兔可能被猫科动物如豹子和狗捕食，而大象是草食性动物，主要以树叶为食。草原和森林环境中存在的树木为食草动物提供了必要的植被。总体而言，这个图表展示了各种生物之间的相互依存关系，其中每个生物都在其生态系统内扮演着特定的角色。

案例六：复杂结构描述

这张图展示了非结构化数据AI洞察发展的路径，按照场景和内容级别的复杂性进行分类。图表的左侧是通用图谱、行业图谱和行业词库等类型的非结构化数据，而右侧则展示了从基础的基于元数据的核心资产管理到更高级别的智能标签、智能定密、文字OCR、物体识别、人像识别等技术应用的层次。图表的上部包含了自主探索式搜索、场景下的知识推荐、基于元数据的核心资产管理以及内容级别结构化分析等功能。图表的下部聚焦在具体的应用场景，如AI引擎、主题趋势预测、安全洞察等。整体上，这个图表提供了一种视觉化的方式来理解和规划在不同领域中如何有效地利用和管理非结构化数据。

扇形结构应该是识别不出来，是我要求太高了

案例七：复杂表格

尝试搜索功能，所在行一般是对的，列感觉有点瞎蒙

尝试转markdown

Description	2023 m$	2022 $m	2021 $m	2020 $m	2019 $m
Net interest income	35,796	30,377	26,489	27,578	30,462
Net fee income	11,845	11,770	13,097	11,874	12,023
Net income from financial instruments held for trading or managed on a fair value basis	16,661	10,278	7,744	9,582	10,231
Net income/(expense) from assets and liabilities of insurance businesses, including related derivatives, measured at fair value through profit or loss	7,887	(4,053)	3,081	2,478	3,479
Net insurance premium income	(7,809)	10,870	10,093	10,636	-
Insurance finance (expense)/income	(1,078)	13,799	-	-	-
Insurance service result	1,581	809	-	-	-
Gain on acquisition	(1,141)	(266)	1,687	1,866	4,194
Total operating income	66,058	50,620	63,940	64,071	71,024
Net income before operating expenses and other charges	(14,388)	-	-	-	-
Net income before income taxes	66,058	50,620	49,552	50,429	56,098
Net income before credit impairment charges	(3,447)	(3,584)	(928)	(8,176)	(7,756)
Net operating income	62,611	51,480	40,512	34,641	33,544
Total operating expenses excluding impairment of goodwill and other intangible assets	(32,355)	(32,887)	(33,044)	(34,955)	(37,394)
Impairment of goodwill and other intangible assets	285	(147)	(733)	(1,388)	(7,394)
Operating profit	30,541	15,440	7,180	7,160	15,993
Share of profit in associates and joint ventures	2,807	2,723	3,046	2,597	1,354
Impairment of interest in associate	(3,000)	-	-	-	-
Profit before tax	30,348	17,908	18,906	8,777	13,347
Tax expense	(5,789)	(14,693)	(2,678)	(4,639)	(8,709)
Profit for the year	24,559	14,699	13,096	6,708	8,099
Attributable to:
- Ordinary

结果一般，有很多错的，而且没有识别完就结束了