小智Pro:给小智装上眼睛,无需设备摄像头,MCP实现

前文,分享了【小智Pro】系列文章:

小智Pro:智能闹钟提醒 + 云端同步,端云协同方案

小智Pro:在线点歌+歌词同步,支持打断和搜索,端云协同方案

小智Pro:给小智装上"知识外挂",从此告别一问三不知

远程控制+文字唤醒,小智Pro开放API调用,释放小智无限潜力

零门槛为小智接入MCP,小智Pro焕新上线:MCP广场+自定义服务

小智Pro:接入长期记忆,一个更懂你、有灵魂的小智

接下来的问题:如何给小智接入眼睛

设备端必须上摄像头?

很多朋友手头的板子,压根没有摄像头,而换一个带摄像头的板子成本太高。

如何为没有摄像头的板子接入视觉能力?

今日分享,聊聊:小智Pro的具体做法👇:

  • 平台侧:视觉理解的架构设计
  • 用户侧:用户如何接入

1. 视觉理解架构设计

整体采用前后端分离的设计模式,前端负责用户交互和可视化管理,后端提供 API 接口和服务治理,底层通过WebSocket实现实时通信。

复制代码
┌─────────────────────────────────────────────────────────────┐
│                         浏览器端                              │
│  ┌─────────────┐  ┌─────────────┐  ┌─────────────┐          │
│  │ 视觉交互按钮 │  │ 摄像头控制   │  │ 结果展示     │          │
│  └──────┬──────┘  └──────┬──────┘  └──────┬──────┘          │
│         │                │                │                 │
│         └────────────────┴────────────────┘                 │
│                          │                                   │
│                    WebSocket 连接                            │
└──────────────────────────┼───────────────────────────────────┘
                           │
                    wss://domain/ws
                           │
┌──────────────────────────▼───────────────────────────────────┐
│                      MCP 服务端                           │
│  ┌─────────────────────────────────────────────────────┐    │
│  │  应用层                                        │    │
│  │  ├─ WebSocket 路由 (/ws)                            │    │
│  │  │   ├─ 连接管理(维护所有客户端连接)               │    │
│  │  │   ├─ 指令下发(request_camera, capture 等)       │    │
│  │  │   └─ 数据接收(图片上传、状态反馈)               │    │
│  │  │                                                     │    │
│  │  ├─ MCP 工具定义                                     │    │
│  │  │   ├─ camera_capture: 拍照工具                     │    │
│  │  │   ├─ image_analysis: 图像分析工具                 │    │
│  │  │   └─ ...                                          │    │
│  │  │                                                     │    │
│  │  └─ AI 模型调用                                       │    │
│  │      ├─ 调用视觉模型分析图片                          │    │
│  │      └─ 返回分析结果                                  │    │
│  └─────────────────────────────────────────────────────┘    │
└─────────────────────────────────────────────────────────────┘

服务连接成功后,用户授权浏览器开启摄像头

设备端发起调用摄像头请求,服务端拿到图片进行解析并返回给设备端,调用成功示例:

2. 视觉理解核心功能

对于用户而言,只需两步:

    1. 浏览器中小智Pro控制台打开摄像头;
    1. 然后,你可以对小智说:
    • '帮我看看这是哪里'
    • '帮我看看这道题怎么做'

对话过程中,设备端通过 MCP 调用远程摄像头获取图片,并通过视觉大模型获取图片内容理解。

如果成功调用,屏幕or日志中会看到self.vision.analysis工具调用。

写在最后

本文分享了小智Pro 接入视觉理解的实现方案。

如果对你有帮助,不妨点赞收藏备用。

欢迎体验 小智Pro 更多功能,请戳👇:

https://mkwyqeoebedx.sealosbja.site

注:视觉理解能力需设备端固件v2.2.1.1版支持。

目前已全面适配小智官方仓库收录的开发板型号,下载地址:

https://github.com/hougeai/xiaozhiPro/releases

有任何问题,欢迎进群交流。

相关推荐
诚思报告YH1 小时前
肽类治疗药物市场洞察:2026-2032年复合增长率(CAGR)为8.4%
大数据·人工智能
量子-Alex1 小时前
【大模型智能体】作为数字原子与分子的AI智能体:大型语言模型在计算生物物理领域开启新纪元
人工智能·语言模型·自然语言处理
jerryinwuhan1 小时前
LY模型流程
人工智能·深度学习·机器学习
诚思报告YH2 小时前
血浆分馏产品市场前瞻:2026-2032年复合增长率(CAGR)为7.0%
人工智能
康康的AI博客2 小时前
AI驱动的法律智能化:通过多模型平台提升合同审查与法规解读的精准度
大数据·人工智能
码云数智-大飞2 小时前
Clawdbot 的“永久记忆”机制探秘:如何让 AI 记住每一次对话
人工智能
AI资源库2 小时前
stepfun-ai/Step-3.5-Flash模型深入解析
人工智能·语言模型·架构
一品威客爱开发2 小时前
跑腿 APP 开发:双端协同与场景化服务构建
人工智能
智算菩萨2 小时前
指令遵循的能力涌现:对齐假设与任务泛化
人工智能·aigc