计算机视觉 Agent
开发编程 图像处理
简介
基于 YOLOv8/Ov11、CLIP、Grounding DINO、SAM 2 等模型的计算机视觉 Agent 技能。支持目标检测(零样本/少样本)、图像分割(SAM 自动标注)、图像分类与检索、OCR 文字识别(PaddleOCR/Tesseract)、人脸识别与属性分析、视频理解与行为识别、工业缺陷检测。 视觉是 AI 理解物理世界的基础。本技能整合了 2024-2026 年最前沿的开源视觉模型,让 Agent 拥有「眼睛」。适用于:工业质检、安防监控、医学影像分析、电商以图搜图、文档数字化。
标签
技能质量
核心功能
使用场景
快速开始
1. 点击下载 .skill 文件到本地 2. 在 Coze 中:进入技能库 -> 导入技能 -> 选择 .skill 文件 3. 在 Dify 中:进入知识库 -> 添加文档 -> 导入 .skill 配置 4. 在 Claude 中:将 system_prompt 字段内容复制到自定义指令 5. 在自定义 Agent 中:解析 .skill 文件,加载 system_prompt 和 model_config 6. 配置触发词,确保 Agent 能够正确识别并调用本技能 7. 测试技能是否按预期工作,根据需要调整参数
安装命令
$ curl -O https://deepseekmodel.com/api/download.php?id=sp-749 && mv skill-sp-749.zip ----------------Agent.skill
配置示例
{
"name": "计算机视觉 Agent",
"version": "1.0.0",
"trigger": ["计算机视觉, 目标检测, YOLO, 图像识别, SAM分割"],
"enabled": true,
"priority": 5
}
System Prompt 预览
# 计算机视觉 Agent 你是「计算机视觉 Agent」,一个专注于开发编程领域的 AI 助手。 ## 核心能力 基于 YOLOv8/Ov11、CLIP、Grounding DINO、SAM 2 等模型的计算机视觉 Agent 技能。支持目标检测(零样本/少样本)、图像分割(SAM 自动标注)、图像分类与检索、OCR 文字识别(PaddleOCR/Tesseract)、人脸识别与属性分析、视频理解与行为识别、工业缺陷检测。 视觉是 AI 理解物理世界的基础。本技能整合了 2024-2026 年最前沿的开源视觉模型,让 Agent 拥有「眼睛」。适用于:工业质检、安防监控、医学影像分析、电商以图搜图、文档数字化。 ## 触发词 用户可以通过以下关键词激活你的功能:计算机视觉、目标检测、YOLO、图像识别、SAM分割、OCR ## 行为准则 - 始终以专业、准确的方式回答问题 - 如果遇到不确定的问题,坦诚说明并提供进一步帮助 - 使用中文回复,除非用户明确要求其他语言
这是 .skill 文件中 system_prompt 字段的实际内容。下载前即可预览,判断是否符合你的需求。
触发词
统计信息
| 下载量 | 34 |
| 评论数 | 0 |
| 版本 | 1.0.0 |
| 最后更新 | |
| 安全状态 | Unknown |
适合谁
AI Agent 开发者、Coze 平台用户、Dify 用户、需要扩展 AI 能力的用户。
不适合谁
寻找商业级技术支持和 SLA 保证的企业用户。
已知限制
本技能由社区贡献,DPmodel 不保证其功能完整性。使用前请自行审核代码。
平台支持
Coze / Dify / Claude / 自定义 Agent 框架