在 DeepSeek Harness 的开发中,纯文本模型虽然处理能力强大,但缺乏对视觉信息的理解能力。要解决这一问题,通常需要手动处理图片文件或切换到多模态模型。dsh-vision-analysis 插件提供了一种标准化的方式,通过兼容 OpenAI 或 Anthropic 格式的视觉端点,将任意视觉模型接入 Harness。
插件定位¶
该插件由开发者 Harvey-Will 维护,定位为 DeepSeek Harness 的图像理解工具。它支持 8 种分析模式,并兼容任意 OpenAI/Anthropic 视觉端点。插件内置了 OVHcloud Qwen2.5-VL-72B 的免费视觉源,同时也支持自定义端点。
安装与启用¶
安装插件需要使用 DSH 的 CLI 命令。安装后需要重启配置文件才能生效。
dsh plugin --profile web add github:Harvey-Will/dsh-vision-analysis
安装完成后,插件会出现在 Settings → 插件配置 中,你可以在此进行具体参数的调整。
核心功能¶
该插件提供了以下核心能力:
- 多模式分析:内置 8 种分析模式,包括描述、OCR、UI 评审、图表取数、目标检测、对比、代码生成和端点诊断。
- 多端点支持:支持 OpenAI
chat/completions或 Anthropicmessages格式。可接入 MiMo、Step、SiliconFlow、OpenRouter、GPT-4o、Claude、Qwen-VL 或本地 Ollama/LM Studio 等模型。 - 输入支持:支持绝对本地路径、
http(s)URL 或 base64data:URL。 - 结构化输出:针对 OCR 和图表取数,插件会返回机器可读的 JSON 数据,方便 Agent 直接处理。
- 隐私优先:图片的字节流不会进入会话日志,也不会传给主模型,仅在插件内部处理。
使用方式¶
插件提供了 analyze_image 工具供 Agent 调用,同时也支持在对话中直接粘贴图片。
1. 使用 analyze_image 工具¶
这是最直接的用法,Agent 可以读取本地文件或 URL 并进行分析。
Use analyze_image to OCR "/tmp/screenshot.png" and tell me what it says.
2. 对话中粘贴图片(图像桥接)¶
要在对话中直接发送图片,需要在配置中开启图像桥接功能。
首先,在 settings.yaml 的模型配置中声明图像输入能力:
llm-deepseek.models:
your-text-model:
inputModalities: [text, image]
然后,在插件配置中指定要桥接的模型列表:
bridgeModels: [your-text-model]
配置完成后,在对话中直接粘贴图片,插件会自动将其路由到视觉端点进行处理。
配置项说明¶
插件的核心配置项位于 Settings → 插件配置。以下为关键参数:
apiFormat: 接口格式,可选openai或anthropic。baseURL: 视觉端点的 API 地址。apiKey: API 密钥。留空时将使用通用视觉 API 或本地模型。model: 视觉模型名称。defaultMode: 默认分析模式,默认为describe。maxImages: 单次调用最多支持的图片数量,默认为 2,最大支持 4。maxBytes: 单张图片的大小限制,默认为 10MB。
注意事项¶
- 依赖项:插件运行仅依赖两个轻量级库:
@deepseek-ai/schemastery和@deepseek-ai/dsh-settings。 - 权限与安全:插件以当前 DSH 进程的权限运行。安装前应检查源码与许可证(MIT)。
- 限制条件:单次调用最多处理 4 张图片;单张图片最大限制为 10MB。
总结¶
dsh-vision-analysis 为 DSH 提供了标准化的视觉接入能力。它通过统一的接口屏蔽了不同视觉模型之间的差异,并提供了针对特定场景(如 OCR、图表取数)的优化模式,适合需要在 Harness 中集成视觉能力的开发者使用。