在 DeepSeek Harness 的开发中,纯文本模型虽然处理能力强大,但缺乏对视觉信息的理解能力。要解决这一问题,通常需要手动处理图片文件或切换到多模态模型。dsh-vision-analysis 插件提供了一种标准化的方式,通过兼容 OpenAI 或 Anthropic 格式的视觉端点,将任意视觉模型接入 Harness。

插件定位

该插件由开发者 Harvey-Will 维护,定位为 DeepSeek Harness 的图像理解工具。它支持 8 种分析模式,并兼容任意 OpenAI/Anthropic 视觉端点。插件内置了 OVHcloud Qwen2.5-VL-72B 的免费视觉源,同时也支持自定义端点。

安装与启用

安装插件需要使用 DSH 的 CLI 命令。安装后需要重启配置文件才能生效。

dsh plugin --profile web add github:Harvey-Will/dsh-vision-analysis

安装完成后,插件会出现在 Settings → 插件配置 中,你可以在此进行具体参数的调整。

核心功能

该插件提供了以下核心能力:

  1. 多模式分析:内置 8 种分析模式,包括描述、OCR、UI 评审、图表取数、目标检测、对比、代码生成和端点诊断。
  2. 多端点支持:支持 OpenAI chat/completions 或 Anthropic messages 格式。可接入 MiMo、Step、SiliconFlow、OpenRouter、GPT-4o、Claude、Qwen-VL 或本地 Ollama/LM Studio 等模型。
  3. 输入支持:支持绝对本地路径、http(s) URL 或 base64 data: URL。
  4. 结构化输出:针对 OCR 和图表取数,插件会返回机器可读的 JSON 数据,方便 Agent 直接处理。
  5. 隐私优先:图片的字节流不会进入会话日志,也不会传给主模型,仅在插件内部处理。

使用方式

插件提供了 analyze_image 工具供 Agent 调用,同时也支持在对话中直接粘贴图片。

1. 使用 analyze_image 工具

这是最直接的用法,Agent 可以读取本地文件或 URL 并进行分析。

Use analyze_image to OCR "/tmp/screenshot.png" and tell me what it says.

2. 对话中粘贴图片(图像桥接)

要在对话中直接发送图片,需要在配置中开启图像桥接功能。

首先,在 settings.yaml 的模型配置中声明图像输入能力:

llm-deepseek.models:
  your-text-model:
    inputModalities: [text, image]

然后,在插件配置中指定要桥接的模型列表:

bridgeModels: [your-text-model]

配置完成后,在对话中直接粘贴图片,插件会自动将其路由到视觉端点进行处理。

配置项说明

插件的核心配置项位于 Settings → 插件配置。以下为关键参数:

  • apiFormat: 接口格式,可选 openai 或 anthropic。
  • baseURL: 视觉端点的 API 地址。
  • apiKey: API 密钥。留空时将使用通用视觉 API 或本地模型。
  • model: 视觉模型名称。
  • defaultMode: 默认分析模式,默认为 describe。
  • maxImages: 单次调用最多支持的图片数量,默认为 2,最大支持 4。
  • maxBytes: 单张图片的大小限制,默认为 10MB。

注意事项

  1. 依赖项:插件运行仅依赖两个轻量级库:@deepseek-ai/schemastery 和 @deepseek-ai/dsh-settings。
  2. 权限与安全:插件以当前 DSH 进程的权限运行。安装前应检查源码与许可证(MIT)。
  3. 限制条件:单次调用最多处理 4 张图片;单张图片最大限制为 10MB。

总结

dsh-vision-analysis 为 DSH 提供了标准化的视觉接入能力。它通过统一的接口屏蔽了不同视觉模型之间的差异,并提供了针对特定场景(如 OCR、图表取数)的优化模式,适合需要在 Harness 中集成视觉能力的开发者使用。