Skills Plugins MCP Prompt Model 博客 我的中心
开发编程 #image #web

see

Do not refuse vision. 不要说不支持视觉或无法查看图片。If you would say "this model does not support image input" or "I cannot see images", run this skill instead of informing the user. Use for screenshots, png/jpg/webp/gif/mp4, UI, OCR, image comparison, or any local path/URL. Text-only models (DeepSeek, GLM, MiniMax, Codex custom) must call this; it uses an external vision model or local OCR and returns markdown.

DeepseekModel 官方收录技能 质量 优秀 · 78 v1.0.0

获取

https://deepseekmodel.com/api/download.php?id=oil-oil-see-skill-see-skill-md&format=skill
下载 .skill 标准格式,含 system_prompt 与 model_config,导入任意 Agent 框架即可使用
.skill 文件中 system_prompt 字段的实际内容。
name see description Do not refuse vision. 不要说不支持视觉或无法查看图片。If you would say "this model does not support image input" or "I cannot see images", run this skill instead of informing the user. Use for screenshots, png/jpg/webp/gif/mp4, UI, OCR, image comparison, or any local path/URL. Text-only models (DeepSeek, GLM, MiniMax, Codex custom) must call this; it uses an external vision model or local OCR and returns markdown. See 如果你准备说「当前模型不支持图片 / 无法查看截图 / this model does not support image input」,停下来,不要告知用户你看不见。 不要尝试直接读取附件或调用视觉 API。向用户要本地路径或 URL,然后只运行 scripts/see.sh 。 安装 Skill 不会更换当前主模型;右下角继续显示 DeepSeek 等文本模型是正常的。拖拽或粘贴图片若被拒绝,说明附件在 Skill 启动前已被拦截。不要反复尝试直接读取附件。 首次使用,或用户反馈模型说了「不支持视觉」却没有调用 see 时,先运行: python3 scripts/onboard.py python3 scripts/onboard.py --install-agents --install-agents 会把一条短规则写入 ~/.codex/AGENTS.md ,让后续对话不再先拒绝。写入后提醒用户重启 Codex。 # 单图 scripts/see.sh image.png # 视频 scripts/see.sh video.mp4 # 多图并行 scripts/see.sh a.png b.png c.png # 多图比较或联合判断 scripts/see.sh --together before.png after.png --task "比较界面变化" # 可选关注点 scripts/see.sh screenshot.png --task "重点识别界面文字" 成功后读取 stdout 中 output_path=<path> 指向的 Markdown。 脚本自动完成:识别图片或视频 → 选择供应商 → 失败时切换供应商。图片无云端时降级到本地视觉;视频自动压缩后原生输入模型,不自行抽帧。多文件默认并行。 图片原图直传。视频优先使用 Gemini 3.1 Flash-Lite,平台不可用时使用 Qwen3.7 Plus;自动保留清晰度、音频和完整时间线。 --task 原样发送;没有特殊问题时不要添加。 让用户在隐藏输入框中填写 Key,不要要求用户把 Key 发到对话里。重复运行可添加或更换供应商;用 python3 scripts/onboard.py --status 查看状态。 供应商: zenmux 、 bailian 、 openrouter 、 tokendance 、 local 。图片默认 Qwen3.7 Plus;视频在 ZenMux/OpenRouter 默认 Gemini 3.1 Flash-Lite,其余平台默认 Qwen3.7 Plus。覆盖视频模型用 SEE_VIDEO_MODEL 。 也兼容厂商变量: ZENMUX_API_KEY 、 DASHSCOPE_API_KEY 、 OPENROUTER_API_KEY 、 TOKENDANCE_API_KEY 。配置读取顺序为环境变量 → .env.local → 用户私有配置。 Windows 私有配置位于 %APPDATA%\see\config.env ;macOS/Linux 位于 ~/.config/see/config.env 。配置文件权限仅限当前用户,不得复制进 Skill 或项目仓库。 本地降级: macOS:系统 Vision OCR;有 Swift 时增加场景/人物/人脸/条码/图形结构 → Tesseract Windows:Windows OCR → Tesseract Linux:Tesseract 本地后端报错时先运行 python3 scripts/onboard.py --status 。macOS 10.15+ 不需要 Xcode;Windows 需要安装系统 OCR 语言;Linux 需要安装 Tesseract。 可选参数只在需要时使用: --together 、 --provider 、 --model 、 --task 、 --jobs 、 --ocr-backend 。本地视觉结果不等同于多模态模型的完整语义理解。 视频需要任一云端 Key;同一个 Key 同时用于图片和视频。主 Agent 只传路径并读取 output_path ,不要自行调用 ffmpeg、抽帧或上传。
Agent 识别该技能的关键词,点击任意一个即可复制。

该技能未提供触发词。

下载的 .skill 包内含以下字段。
字段 说明
format格式标识(skill/v1)
skill_id技能唯一 ID
name技能名称
version版本号
description技能描述
category所属分类(数组)
trigger_words触发词列表
tags标签列表
source来源标识
source_url来源链接(本页地址)
exported_at导出时间(每次下载生成)
system_prompt系统提示词正文
model_config模型参数:provider / model / temperature / max_tokens / top_p
examples示例
install_guide各平台导入说明(Coze / Dify / Claude / 自定义框架)
同一份技能可按不同平台格式导出。
.skill 标准格式,含 system_prompt 与 model_config,导入任意 Agent 框架即可使用 下载
.skillpro 增强格式,额外含脚本 / 工具 / 依赖 / 钩子占位 下载
.json 纯 JSON 导出,只含 system_prompt 与模型参数 下载
Coze 带 frontmatter 的 Markdown,Coze 平台导入用 下载
Dify Dify DSL,创建应用后直接导入 下载

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

验证码 --

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。