Skills Plugins MCP Prompt Model 博客 我的中心

image-recognition

图片识别与图文理解,基于 PaddleOCR-VL 模型,支持识别图片中的文字、场景、物体等信息。支持109种语言,可输出JSON或Markdown格式。

DeepseekModel キュレーション済みスキル 品質 良好 · 48 v1.0.0

取得

https://deepseekmodel.com/api/download.php?id=caoronglin-copaw-skills-skills-image-recognition-skill-md&format=skill
ダウンロード .skill 標準形式。system_prompt と model_config を収録し、任意の Agent で利用可能
.skill ファイルの system_prompt フィールドの実際の内容。
name Image Recognition description 图片识别与图文理解,基于 PaddleOCR-VL 模型,支持识别图片中的文字、场景、物体等信息。支持109种语言,可输出JSON或Markdown格式。 triggers ["识别图片","看图","图片识别","OCR","文字识别","图片内容"] mcp {"command":"uvx","args":["paddleocr-vl-mcp"],"env":{"PADDLEOCR_API_KEY":"your_api_key"}} 图片识别 MCP 技能 功能说明 基于 PaddleOCR-VL 的图像识别服务: 📝 文字识别 :提取图片中的文字内容 🌍 多语言支持 :支持109种语言的OCR 📊 结构化输出 :JSON或Markdown格式 📐 版面分析 :识别文本、表格、公式、图表 🎯 精确定位 :提供文字位置信息 核心模型 PaddleOCR-VL 1.5 百度开源的视觉语言模型: 参数量 :0.9B(超轻量) 支持语言 :109种 识别能力 :文本、表格、公式、图表 输出格式 :JSON、Markdown 工具列表 1. extract_text - 文字提取 功能 :从图片中提取文字内容 参数说明 : 参数 类型 必需 说明 image string ✅ 图片文件路径或URL format string ❌ 输出格式:json/markdown,默认markdown language string ❌ 语言代码,默认自动检测 使用示例 : { "image" : "/path/to/image.png" , "format" : "markdown" , "language" : "ch" } 返回信息 : 识别的文字内容 文字位置信息(JSON格式) 置信度分数 2. analyze_document - 文档分析 功能 :分析文档图片的版面结构 参数 : image : 文档图片 output_format : 输出格式 返回 : 文本区域 表格区域 图片区域 版面结构 3. extract_table - 表格提取 功能 :从图片中提取表格数据 参数 : image : 包含表格的图片 返回 : 表格结构 单元格内容 表头识别 配置方式 获取API Key 访问PaddleOCR服务提供商 注册账号并获取API Key 配置到环境变量 MCP配置 { "mcpServers" : { "image-recognition" : { "command" : "uvx" , "args" : [ "paddleocr-vl-mcp" ] , "env" : { "PADDLEOCR_API_KEY" : "your-api-key" } } } } 使用场景 1. 文档数字化 用户:帮我把这份扫描文档转成文字 助手:[调用extract_text,返回Markdown格式] 2. 表格提取 用户:提取这张图片里的表格数据 助手:[调用extract_table,返回结构化数据] 3. 截图文字提取 用户:识别这张截图里的文字 助手:[调用extract_text] 4. 多语言识别 用户:识别这张日文图片的内容 助手:[设置language=ja进行识别] 支持的语言 主要语言 中文(简体、繁体) 英文 日文 韩文 法语、德语、西班牙语等 总计 支持 109种语言 的OCR识别 输出格式对比 JSON格式 { "text" : "识别的文字" , "bbox" : [ x1 , y1 , x2 , y2 ] , "confidence" : 0.95 } 适用场景 :需要精确位置信息、程序处理 Markdown格式 # 文档标题 正文内容... | 列1 | 列2 | |-----|-----| | 数据 | 数据 | 适用场景 :文档阅读、内容展示 触发时机 用户需要识别图片文字 文档数字化处理 表格数据提取 多语言文字识别 最佳实践 1. 选择合适的格式 # 需要位置信息 extract_text(image, format = "json" ) # 只需要文本内容 extract_text(image, format = "markdown" ) 2. 指定语言提高准确率 # 中文文档 extract_text(image, language= "ch" ) # 日文文档 extract_text(image, language= "ja" ) # 混合语言(自动检测) extract_text(image, language= "auto" ) 3. 处理复杂文档 # 先分析版面 layout = analyze_document(image) # 再提取各区域内容 for region in layout.regions: if region. type == "table" : extract_table(region) else : extract_text(region) 注意事项 ⚠️ 重要提示 : 图片质量影响识别准确率 复杂排版可能需要后期校对 手写文字识别准确率较低 表格识别对格式要求较高 应用场景 场景 推荐工具 说明 文档数字化 extract_text 扫描件转文字 表格录入 extract_table 图片表格转Excel 截图提取 extract_text 快速获取截图文字 学术论文 analyze_document 识别公式图表 官方资源 模型 : PaddleOCR-VL 1.5 GitHub : https://github.com/PaddlePaddle/PaddleOCR 文档 : https://github.com/PaddlePaddle/PaddleOCR/blob/main/doc/doc_ch/whl.md 支持 : 百度开源项目 常见问题 Q: 识别准确率不高怎么办? A : 确保图片清晰 指定正确的语言 尝试不同的输出格式 Q: 支持手写文字吗? A : 支持,但准确率可能低于印刷体 Q: 如何处理表格? A : 使用extract_table工具,会自动识别表格结构 Q: 可以识别公式吗? A : 可以,PaddleOCR-VL支持公式识别 与其他工具配合 文档处理流程 pdf(提取页面)→ image-recognition(识别)→ 整理归档 数据录入流程 image-recognition(识别表格)→ xlsx(写入Excel)→ 数据分析 更新时间: 2026-03-08 版本: 1.0 适用对象: 文档处理、数据提取、内容识别
このスキルを起動するキーワード。クリックでコピーできます。

このスキルにはトリガーワードがありません。

ダウンロードした .skill に含まれるフィールド。
フィールド 説明
formatフォーマット識別子(skill/v1)
skill_idスキル固有 ID
nameスキル名
versionバージョン
description説明
categoryカテゴリ(配列)
trigger_wordsトリガーワード
tagsタグ
sourceソース
source_urlソース URL(本ページ)
exported_atエクスポート日時(ダウンロード毎)
system_promptシステムプロンプト本文
model_configモデル設定:provider / model / temperature / max_tokens / top_p
examplesサンプル
install_guide各プラットフォームの導入説明(Coze / Dify / Claude / カスタム)
同じスキルを各プラットフォーム形式で出力できます。
.skill 標準形式。system_prompt と model_config を収録し、任意の Agent で利用可能 ダウンロード
.skillpro 拡張形式。scripts / tools / dependencies / hooks を含む ダウンロード
.json 純粋な JSON 出力。system_prompt とモデル設定のみ ダウンロード
Coze frontmatter 付き Markdown。Coze へのインポート用 ダウンロード
Dify Dify DSL。アプリ作成後にそのままインポート ダウンロード

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。