一、 前言

你是否想过,如果你家里的 AI 智能体能直接通过摄像头看到你的房间、你的午餐,甚至是你正在写的作业,会是种什么样的体验?

最近我发现了一个非常实用的 MCP(Model Context Protocol)服务器——视觉理解。它通过 WebSocket 连接摄像头,让 AI 具备了实时视觉能力,并集成了 OpenAI、Gemini、智谱 GLM-4V、阿里 Qwen-VL 等国内外主流多模态大模型。今天就来拆解一下它的功能和配置流程。


二、 核心功能:不只是简单的“拍照”

这款 MCP 服务器最强大的地方在于它内置了一套专用工具集,能让 AI 完成非常具体的任务:

  • capture_and_analyze:通用视觉工具,让 AI 描述“它看到了什么”。

  • provide_outfit_advice穿搭博主上线! 评价你的衣服颜色、风格和材质。

  • solve_problem学霸模式。 直接看图解数学题或逻辑谜题。

  • analyze_diet健身党福利。 识别食物、估算分量并分类,输出 JSON 结构化数据,方便接入饮食记录。

  • identify_plant绿植杀手救星。 识别植物并给出浇水、光照建议。

  • organize_space整理专家。 针对凌乱的办公桌提供收纳建议。

  • generate_social_media_post朋友圈助手。 基于当前画面直接生成带热门标签的文案。


三、 快速配置指南

配置这个服务非常简单,只需要几步即可完成绑定:

  1. 访问详情页:进入 https://imcp.pro/mcps/9hws7C

  2. 绑定智能体:在页面点击“绑定”按钮,选择你常用的 AI 智能体。

  3. 开启摄像头预览(关键步):

    • 在智能体界面找到 视觉理解 按钮并点击。

    • 点击 “开启摄像头预览” 并授权。

    • 注意:请保持预览界面开启,不要退出,这样 AI 才能随时“调用”你的摄像头。


四、 实战对话示例

配置好之后,你可以直接跟你的 AI 说:

  • 💬 “请问你现在看见了什么?”

  • 💬 “帮我看一下我这个穿搭怎么样,适合去面试吗?”

  • 💬 “这道数学题怎么解?请告诉我步骤。”

  • 💬 “看下我今天中午吃了什么?热量高吗?”

  • 💬 “我要发一条微信朋友圈,请根据我现在的画面写一段走心的文案。”


五、 深入学习

如果你想看更直观的操作演示,推荐观看 B 站的教学视频:

小智MCP-视觉理解 https://www.bilibili.com/video/BV1j26KB2Eup/?share_source=copy_web&vd_source=273f4361f79e8b2ef7f935197008b1ae

六、 总结

视觉理解 MCP 服务器的出现,标志着 AI 从“文本对话”真正迈向了“感知现实”。它不仅支持多种主流模型,更通过垂直化的工具设计,解决了许多生活中的实际痛点。

传送门:

如果你在使用过程中有什么有趣的发现,或者遇到了配置问题,欢迎在评论区交流!

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐