小智Pro:给小智装上眼睛,无需设备摄像头,MCP实现

前文,分享了【小智Pro】系列文章:

小智Pro:智能闹钟提醒 + 云端同步,端云协同方案

小智Pro:在线点歌+歌词同步,支持打断和搜索,端云协同方案

小智Pro:给小智装上"知识外挂",从此告别一问三不知

远程控制+文字唤醒,小智Pro开放API调用,释放小智无限潜力

零门槛为小智接入MCP,小智Pro焕新上线:MCP广场+自定义服务

小智Pro:接入长期记忆,一个更懂你、有灵魂的小智

接下来的问题:如何给小智接入眼睛

设备端必须上摄像头?

很多朋友手头的板子,压根没有摄像头,而换一个带摄像头的板子成本太高。

如何为没有摄像头的板子接入视觉能力?

今日分享,聊聊:小智Pro的具体做法👇:

  • 平台侧:视觉理解的架构设计
  • 用户侧:用户如何接入

1. 视觉理解架构设计

整体采用前后端分离的设计模式,前端负责用户交互和可视化管理,后端提供 API 接口和服务治理,底层通过WebSocket实现实时通信。

复制代码
┌─────────────────────────────────────────────────────────────┐
│                         浏览器端                              │
│  ┌─────────────┐  ┌─────────────┐  ┌─────────────┐          │
│  │ 视觉交互按钮 │  │ 摄像头控制   │  │ 结果展示     │          │
│  └──────┬──────┘  └──────┬──────┘  └──────┬──────┘          │
│         │                │                │                 │
│         └────────────────┴────────────────┘                 │
│                          │                                   │
│                    WebSocket 连接                            │
└──────────────────────────┼───────────────────────────────────┘
                           │
                    wss://domain/ws
                           │
┌──────────────────────────▼───────────────────────────────────┐
│                      MCP 服务端                           │
│  ┌─────────────────────────────────────────────────────┐    │
│  │  应用层                                        │    │
│  │  ├─ WebSocket 路由 (/ws)                            │    │
│  │  │   ├─ 连接管理(维护所有客户端连接)               │    │
│  │  │   ├─ 指令下发(request_camera, capture 等)       │    │
│  │  │   └─ 数据接收(图片上传、状态反馈)               │    │
│  │  │                                                     │    │
│  │  ├─ MCP 工具定义                                     │    │
│  │  │   ├─ camera_capture: 拍照工具                     │    │
│  │  │   ├─ image_analysis: 图像分析工具                 │    │
│  │  │   └─ ...                                          │    │
│  │  │                                                     │    │
│  │  └─ AI 模型调用                                       │    │
│  │      ├─ 调用视觉模型分析图片                          │    │
│  │      └─ 返回分析结果                                  │    │
│  └─────────────────────────────────────────────────────┘    │
└─────────────────────────────────────────────────────────────┘

服务连接成功后,用户授权浏览器开启摄像头

设备端发起调用摄像头请求,服务端拿到图片进行解析并返回给设备端,调用成功示例:

2. 视觉理解核心功能

对于用户而言,只需两步:

    1. 浏览器中小智Pro控制台打开摄像头;
    1. 然后,你可以对小智说:
    • '帮我看看这是哪里'
    • '帮我看看这道题怎么做'

对话过程中,设备端通过 MCP 调用远程摄像头获取图片,并通过视觉大模型获取图片内容理解。

如果成功调用,屏幕or日志中会看到self.vision.analysis工具调用。

写在最后

本文分享了小智Pro 接入视觉理解的实现方案。

如果对你有帮助,不妨点赞收藏备用。

欢迎体验 小智Pro 更多功能,请戳👇:

https://mkwyqeoebedx.sealosbja.site

注:视觉理解能力需设备端固件v2.2.1.1版支持。

目前已全面适配小智官方仓库收录的开发板型号,下载地址:

https://github.com/hougeai/xiaozhiPro/releases

有任何问题,欢迎进群交流。

相关推荐
jedi-knight13 小时前
深入浅入 AI Agent:基于 Python 与 ReAct 模式的自主智能体实现
人工智能·python
阿杰学AI13 小时前
AI核心知识131—大语言模型之 自主智能体(简洁且通俗易懂版)
人工智能·ai·语言模型·自然语言处理·agent·智能体·自主智能体
海边夕阳200613 小时前
Vibe Coding与SDD规范驱动:从氛围编程到规范驱动开发
人工智能·驱动开发·经验分享
才兄说14 小时前
机器人二次开发机器狗巡检?异常识别近100%
人工智能·机器人
后端小肥肠14 小时前
一人公司实录:我是怎么用AI工具撑过这一年的,顺手还把社群系统做上线了
人工智能·agent
起个名字都难啊14 小时前
visual studio配置libtorch
人工智能·visual studio
一点一一14 小时前
nestjs+langchain:大模型的基本调用、对message的
人工智能·后端
昊星自动化14 小时前
以房间为单元,筑稳GMP安全屏障-洁净区域风量压差控制技术方案概述
人工智能·国产替代·文丘里阀·实验室通风系统·蝶阀
总写bug的程序员14 小时前
用 AI 蒸馏球员的思维操作系统:qiuyuan-skill 技术解析
人工智能·unity·游戏引擎
超级AI_mes14 小时前
化工MES解决方案:从配方管控到安全追溯的智慧转型
大数据·人工智能·5g·能源·制造·业界资讯·设备采集