主模型只管理解文字,看图交给外部 VLM。
多模态模型粘贴即看,插件自动闲置。
为非多模态模型补上视觉
无论你的 kimi-code 当前用哪个模型、来自哪家服务商,只要它不具备原生图片输入能力,Kimi Eyes 就能为它补上视觉。视觉能力由你自己配置的 VLM 提供,与主模型完全解耦。
让任意文本模型看图
DeepSeek、Qwen 纯文本版、Llama 文本系列、本地部署的文本模型,以及任何第三方 OpenAI 兼容模型。只要它原生不看图,插件就会在消息含图片时引导它调用视觉工具。
零依赖,纯 Node
无 npm 依赖、无原生模块。基于 Node 18+ 原生 fetch 实现。
→ 你配置的 VLM
→ 文本描述
→ 模型作答
双协议支持
- OpenAI 兼容 chat/completions
- Anthropic messages API
三平台截图
- Windows PowerShell(内置)
- macOS pngpaste
- Linux wl-paste / xclip
内置 models.dev 精简数据库
收录 287 个模型并标注是否支持图片输入,用于向导精确标注视觉能力,以及声明主模型后判断是否多模态,实现代码级触发开关。未收录的模型回退关键词猜测。
密钥只发往你的端点
不内置任何密钥,视觉请求只发往你配置的 BaseUrl。API Key 明文存于本地配置(类 Unix 已设 600 权限)。
三步运转
插件声明一个 MCP stdio 服务器,暴露两个工具:read_image(读本地图片)与 read_clipboard_image(读剪贴板截图)。SYSTEM.md 引导模型在需要时调用,服务器按你的协议把图片发给你自配的多模态 API。
配置视觉 API
运行交互向导,选择协议、填写 BaseUrl 与 API Key、挑选多模态模型,1×1 图片验证通过后写入本地配置。
安装并启用插件
在 kimi-code 会话里安装插件并 reload,MCP 服务器随会话自动启动,两个视觉工具注册给模型。
自动触发看图
你 @ 图片路径或截图后提问,模型自动调用视觉工具取回描述并作答。全程零命令。
两种使用方式
作为 kimi-code 插件安装是最简路径;也可作为标准 MCP 服务器挂载到 Claude Code 等任意 MCP 客户端。
# 1. 配置视觉 API(一次性) npx kimi-eyes setup # 2. 在 kimi-code 会话里安装插件 /plugins install https://github.com/billowliu2/kimi-eyes # 3. 启用 /reload # MCP 服务器随会话启动 # 使用 @截图.png 这个图里有什么? # → read_image 分析这张截图 # → read_clipboard_image # 纯文本模型想「粘贴」看图(需先声明 image_in + 注册 skill,详见 README): /skill kimi-eyes 这张图说明什么? # 然后 Alt-V 粘贴图片,回车
# 在系统终端执行(PowerShell / Git Bash) # 挂载为标准 MCP 服务器(全局,任意项目可用) claude mcp add --scope user kimi-eyes \ -- npx --prefer-online -y -p kimi-eyes kimi-eyes-mcp # 配置视觉 API(与 kimi-code 共用同一份配置) npx kimi-eyes setup # 验证连接 claude mcp list # kimi-eyes 应显示 √ Connected # 卸载 claude mcp remove kimi-eyes
看图方式 × image_in
纯文本主模型下,不同看图姿势对 image_in 的要求和可用性不同。
| 看图方式 | 需要 image_in? | 纯文本可用? | 顺滑度 |
|---|---|---|---|
| 截图后随口一问(自动读剪贴板) | 否 | ✅ | 最省事 |
@路径 / 给路径 | 否 | ✅ | 省事 |
/skill kimi-eyes + Alt-V | 是 | ✅ | 多步 |
| 单纯 Alt-V | 声明与否 | ❌ | 走不通 |
日常优先用前两种;只有「就想粘贴」时才走 /skill kimi-eyes。
两个 MCP 工具
工具按需被模型调用。文件先经扩展名与魔数双重校验,剪贴板图片存为临时文件、用完即删。