主模型只管理解文字,看图交给外部 VLM。
多模态模型粘贴即看,插件自动闲置。
为非多模态模型补上视觉
+无论你的 kimi-code 当前用哪个模型、来自哪家服务商,只要它不具备原生图片输入能力,Kimi Eyes 就能为它补上视觉。视觉能力由你自己配置的 VLM 提供,与主模型完全解耦。
+ +让任意文本模型看图
+DeepSeek、Qwen 纯文本版、Llama 文本系列、本地部署的文本模型,以及任何第三方 OpenAI 兼容模型。只要它原生不看图,插件就会在消息含图片时引导它调用视觉工具。
+零依赖,纯 Node
+无 npm 依赖、无原生模块。基于 Node 18+ 原生 fetch 实现。
++ → 你配置的 VLM
+ → 文本描述
+ → 模型作答 +
双协议支持
+-
+
- OpenAI 兼容 chat/completions +
- Anthropic messages API +
三平台截图
+-
+
- Windows PowerShell(内置) +
- macOS pngpaste +
- Linux wl-paste / xclip +
内置 models.dev 精简数据库
+收录 287 个模型并标注是否支持图片输入,用于向导精确标注视觉能力,以及声明主模型后判断是否多模态,实现代码级触发开关。未收录的模型回退关键词猜测。
+密钥只发往你的端点
+不内置任何密钥,视觉请求只发往你配置的 BaseUrl。API Key 明文存于本地配置(类 Unix 已设 600 权限)。
+三步运转
+插件声明一个 MCP stdio 服务器,暴露两个工具:read_image(读本地图片)与 read_clipboard_image(读剪贴板截图)。SYSTEM.md 引导模型在需要时调用,服务器按你的协议把图片发给你自配的多模态 API。
+ +配置视觉 API
+运行交互向导,选择协议、填写 BaseUrl 与 API Key、挑选多模态模型,1×1 图片验证通过后写入本地配置。
+安装并启用插件
+在 kimi-code 会话里安装插件并 reload,MCP 服务器随会话自动启动,两个视觉工具注册给模型。
+自动触发看图
+你 @ 图片路径或截图后提问,模型自动调用视觉工具取回描述并作答。全程零命令。
+两种使用方式
+作为 kimi-code 插件安装是最简路径;也可作为标准 MCP 服务器挂载到 Claude Code 等任意 MCP 客户端。
+ +# 1. 配置视觉 API(一次性) +npx kimi-eyes setup + +# 2. 在 kimi-code 会话里安装插件 +/plugins install https://github.com/billowliu2/kimi-eyes + +# 3. 启用 +/reload # MCP 服务器随会话启动 + +# 使用 +@截图.png 这个图里有什么? # → read_image +分析这张截图 # → read_clipboard_image+
# 在系统终端执行(PowerShell / Git Bash) + +# 挂载为标准 MCP 服务器(全局,任意项目可用) +claude mcp add --scope user kimi-eyes \ + -- npx --prefer-online -y -p kimi-eyes kimi-eyes-mcp + +# 配置视觉 API(与 kimi-code 共用同一份配置) +npx kimi-eyes setup + +# 验证连接 +claude mcp list # kimi-eyes 应显示 √ Connected + +# 卸载 +claude mcp remove kimi-eyes+
两个 MCP 工具
+工具按需被模型调用。文件先经扩展名与魔数双重校验,剪贴板图片存为临时文件、用完即删。
+ +