diff --git a/docs/index.html b/docs/index.html new file mode 100644 index 0000000..229943f --- /dev/null +++ b/docs/index.html @@ -0,0 +1,580 @@ + + + + + + Kimi Eyes - 让非多模态模型也能看图的 kimi-code 视觉插件 + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
+ + +
+
+
+ kimi-code 视觉插件 +

给文本模型
一双看图的眼睛

+

通过你自配的多模态 API,让 DeepSeek、Qwen 文本版、Llama 等非多模态模型也能分析本地图片与剪贴板截图。

+ +
+
+ +
+
+
+ + +
+
+

主模型只管理解文字,看图交给外部 VLM。
多模态模型粘贴即看,插件自动闲置。

+
+
+ + +
+
+ 能力 +

为非多模态模型补上视觉

+

无论你的 kimi-code 当前用哪个模型、来自哪家服务商,只要它不具备原生图片输入能力,Kimi Eyes 就能为它补上视觉。视觉能力由你自己配置的 VLM 提供,与主模型完全解耦。

+ +
+
+ 兼容 +

让任意文本模型看图

+

DeepSeek、Qwen 纯文本版、Llama 文本系列、本地部署的文本模型,以及任何第三方 OpenAI 兼容模型。只要它原生不看图,插件就会在消息含图片时引导它调用视觉工具。

+
+
+ 架构 +

零依赖,纯 Node

+

无 npm 依赖、无原生模块。基于 Node 18+ 原生 fetch 实现。

+
+ 模型 → MCP 工具
+ → 你配置的 VLM
+ → 文本描述
+ → 模型作答 +
+
+
+ 协议 +

双协议支持

+
    +
  • OpenAI 兼容 chat/completions
  • +
  • Anthropic messages API
  • +
+
+
+ 剪贴板 +

三平台截图

+
    +
  • Windows PowerShell(内置)
  • +
  • macOS pngpaste
  • +
  • Linux wl-paste / xclip
  • +
+
+
+ 能力库 +

内置 models.dev 精简数据库

+

收录 287 个模型并标注是否支持图片输入,用于向导精确标注视觉能力,以及声明主模型后判断是否多模态,实现代码级触发开关。未收录的模型回退关键词猜测。

+
+
+ 隐私 +

密钥只发往你的端点

+

不内置任何密钥,视觉请求只发往你配置的 BaseUrl。API Key 明文存于本地配置(类 Unix 已设 600 权限)。

+
+
+
+
+ + +
+
+

三步运转

+

插件声明一个 MCP stdio 服务器,暴露两个工具:read_image(读本地图片)与 read_clipboard_image(读剪贴板截图)。SYSTEM.md 引导模型在需要时调用,服务器按你的协议把图片发给你自配的多模态 API。

+ +
+
+
/ 01
+

配置视觉 API

+

运行交互向导,选择协议、填写 BaseUrl 与 API Key、挑选多模态模型,1×1 图片验证通过后写入本地配置。

+
+
+
/ 02
+

安装并启用插件

+

在 kimi-code 会话里安装插件并 reload,MCP 服务器随会话自动启动,两个视觉工具注册给模型。

+
+
+
/ 03
+

自动触发看图

+

你 @ 图片路径或截图后提问,模型自动调用视觉工具取回描述并作答。全程零命令。

+
+
+
+
+ + +
+
+ 安装 +

两种使用方式

+

作为 kimi-code 插件安装是最简路径;也可作为标准 MCP 服务器挂载到 Claude Code 等任意 MCP 客户端。

+ +
+
+ + +
+ +
+
+ +
# 1. 配置视觉 API(一次性)
+npx kimi-eyes setup
+
+# 2. 在 kimi-code 会话里安装插件
+/plugins install https://github.com/billowliu2/kimi-eyes
+
+# 3. 启用
+/reload # MCP 服务器随会话启动
+
+# 使用
+@截图.png 这个图里有什么?     # → read_image
+分析这张截图                 # → read_clipboard_image
+
+
+ +
+
+ +
# 在系统终端执行(PowerShell / Git Bash)
+
+# 挂载为标准 MCP 服务器(全局,任意项目可用)
+claude mcp add --scope user kimi-eyes \
+  -- npx --prefer-online -y -p kimi-eyes kimi-eyes-mcp
+
+# 配置视觉 API(与 kimi-code 共用同一份配置)
+npx kimi-eyes setup
+
+# 验证连接
+claude mcp list # kimi-eyes 应显示 √ Connected
+
+# 卸载
+claude mcp remove kimi-eyes
+
+
+
+
+
+ + +
+
+

两个 MCP 工具

+

工具按需被模型调用。文件先经扩展名与魔数双重校验,剪贴板图片存为临时文件、用完即删。

+ +
+
+
read_image
+
分析本地图片文件。用户给出图片路径或 @ 引用、且模型不能直接看图时使用。
+
+path string (必填) 本地图片绝对路径 +prompt string (可选) 分析指令,默认描述图片 +# 支持 png jpg jpeg webp gif bmp +
+
+
+
read_clipboard_image
+
捕获系统剪贴板中的图片(如刚截的图)并分析。用户刚截图或复制、未给出路径时使用。
+
+prompt string (可选) 分析指令,默认描述图片 +# 剪贴板图片存临时文件,调用后删除 +
+
+
+
+
+ + +
+
+ 常见问题 +

你可能想问的

+ +
+
+ +
不需要。GPT-4o、Claude 3+、Gemini 等多模态模型粘贴图片即可原生看图,插件会自动闲置。Kimi Eyes 主要服务文本模型,或你想统一走某个外部 VLM 的场景。
+
+
+ +
插件不内置任何密钥,视觉请求只发往你配置的 BaseUrl。Key 以明文存于 ~/.kimi-code/kimi-eyes/config.json(类 Unix 系统已设 600 权限),不会上传到任何第三方。也可用 VISION_API_KEY 等环境变量替代配置文件。
+
+
+ +
PNG、JPG、JPEG、WEBP、GIF、BMP。文件会经过扩展名与魔数(magic bytes)双重校验,扩展名不符或内容损坏会被拒绝。
+
+
+ +
通常 @ 图片路径或截图后提问就会自动触发。若未触发,可直接命令模型:「调用 read_image 工具分析 D:\xxx.png」。也可设置环境变量或在 config.toml 给模型声明 image_in 能力放行粘贴。
+
+
+
+
+ +
+ + + + + + + diff --git a/docs/og.png b/docs/og.png new file mode 100644 index 0000000..38d3695 Binary files /dev/null and b/docs/og.png differ diff --git a/docs/robots.txt b/docs/robots.txt new file mode 100644 index 0000000..46176eb --- /dev/null +++ b/docs/robots.txt @@ -0,0 +1,4 @@ +User-agent: * +Allow: / + +Sitemap: https://billowliu2.github.io/kimi-eyes/sitemap.xml diff --git a/docs/sitemap.xml b/docs/sitemap.xml new file mode 100644 index 0000000..e9bfd02 --- /dev/null +++ b/docs/sitemap.xml @@ -0,0 +1,8 @@ + + + + https://billowliu2.github.io/kimi-eyes/ + monthly + 1.0 + +