kimi-code 视觉插件

给文本模型
一双看图的眼睛

通过你自配的多模态 API,让 DeepSeek、Qwen 文本版、Llama 等非多模态模型也能分析本地图片与剪贴板截图。

主模型只管理解文字,看图交给外部 VLM。
多模态模型粘贴即看,插件自动闲置。

能力

为非多模态模型补上视觉

无论你的 kimi-code 当前用哪个模型、来自哪家服务商,只要它不具备原生图片输入能力,Kimi Eyes 就能为它补上视觉。视觉能力由你自己配置的 VLM 提供,与主模型完全解耦。

兼容

让任意文本模型看图

DeepSeek、Qwen 纯文本版、Llama 文本系列、本地部署的文本模型,以及任何第三方 OpenAI 兼容模型。只要它原生不看图,插件就会在消息含图片时引导它调用视觉工具。

架构

零依赖,纯 Node

无 npm 依赖、无原生模块。基于 Node 18+ 原生 fetch 实现。

模型 → MCP 工具
→ 你配置的 VLM
→ 文本描述
→ 模型作答
协议

双协议支持

  • OpenAI 兼容 chat/completions
  • Anthropic messages API
剪贴板

三平台截图

  • Windows PowerShell(内置)
  • macOS pngpaste
  • Linux wl-paste / xclip
能力库

内置 models.dev 精简数据库

收录 287 个模型并标注是否支持图片输入,用于向导精确标注视觉能力,以及声明主模型后判断是否多模态,实现代码级触发开关。未收录的模型回退关键词猜测。

隐私

密钥只发往你的端点

不内置任何密钥,视觉请求只发往你配置的 BaseUrl。API Key 明文存于本地配置(类 Unix 已设 600 权限)。

三步运转

插件声明一个 MCP stdio 服务器,暴露两个工具:read_image(读本地图片)与 read_clipboard_image(读剪贴板截图)。SYSTEM.md 引导模型在需要时调用,服务器按你的协议把图片发给你自配的多模态 API。

/ 01

配置视觉 API

运行交互向导,选择协议、填写 BaseUrl 与 API Key、挑选多模态模型,1×1 图片验证通过后写入本地配置。

/ 02

安装并启用插件

在 kimi-code 会话里安装插件并 reload,MCP 服务器随会话自动启动,两个视觉工具注册给模型。

/ 03

自动触发看图

你 @ 图片路径或截图后提问,模型自动调用视觉工具取回描述并作答。全程零命令。

安装

两种使用方式

作为 kimi-code 插件安装是最简路径;也可作为标准 MCP 服务器挂载到 Claude Code 等任意 MCP 客户端。

# 1. 配置视觉 API(一次性)
npx kimi-eyes setup

# 2. 在 kimi-code 会话里安装插件
/plugins install https://github.com/billowliu2/kimi-eyes

# 3. 启用
/reload # MCP 服务器随会话启动

# 使用
@截图.png 这个图里有什么?     # → read_image
分析这张截图                 # → read_clipboard_image

# 纯文本模型想「粘贴」看图(需先声明 image_in + 注册 skill,详见 README):
/skill kimi-eyes 这张图说明什么? # 然后 Alt-V 粘贴图片,回车
# 在系统终端执行(PowerShell / Git Bash)

# 挂载为标准 MCP 服务器(全局,任意项目可用)
claude mcp add --scope user kimi-eyes \
  -- npx --prefer-online -y -p kimi-eyes kimi-eyes-mcp

# 配置视觉 API(与 kimi-code 共用同一份配置)
npx kimi-eyes setup

# 验证连接
claude mcp list # kimi-eyes 应显示 √ Connected

# 卸载
claude mcp remove kimi-eyes

看图方式 × image_in

纯文本主模型下,不同看图姿势对 image_in 的要求和可用性不同。

看图方式 需要 image_in? 纯文本可用? 顺滑度
截图后随口一问(自动读剪贴板)否✅最省事
@路径 / 给路径否✅省事
/skill kimi-eyes + Alt-V是✅多步
单纯 Alt-V声明与否❌走不通

日常优先用前两种;只有「就想粘贴」时才走 /skill kimi-eyes。

两个 MCP 工具

工具按需被模型调用。文件先经扩展名与魔数双重校验,剪贴板图片存为临时文件、用完即删。

read_image
分析本地图片文件。用户给出图片路径或 @ 引用、且模型不能直接看图时使用。
path string (必填) 本地图片绝对路径 prompt string (可选) 分析指令,默认描述图片 # 支持 png jpg jpeg webp gif bmp
read_clipboard_image
捕获系统剪贴板中的图片(如刚截的图)并分析。用户刚截图或复制、未给出路径时使用。
prompt string (可选) 分析指令,默认描述图片 # 剪贴板图片存临时文件,调用后删除
常见问题

你可能想问的

不需要。GPT-4o、Claude 3+、Gemini 等多模态模型粘贴图片即可原生看图,插件会自动闲置。Kimi Eyes 主要服务文本模型,或你想统一走某个外部 VLM 的场景。
插件不内置任何密钥,视觉请求只发往你配置的 BaseUrl。Key 以明文存于 ~/.kimi-code/kimi-eyes/config.json(类 Unix 系统已设 600 权限),不会上传到任何第三方。也可用 VISION_API_KEY 等环境变量替代配置文件。
PNG、JPG、JPEG、WEBP、GIF、BMP。文件会经过扩展名与魔数(magic bytes)双重校验,扩展名不符或内容损坏会被拒绝。
通常 @ 图片路径或截图后提问就会自动触发。若未触发,可直接命令模型:「调用 read_image 工具分析 D:\xxx.png」。也可设置环境变量或在 config.toml 给模型声明 image_in 能力放行粘贴。