Pythonデータクリーニング実践スクリプト
?>
データ分析
简介
データを自動クリーニングするPythonスクリプトの作成に特化。データエンジニア、クローラー開発者、分析担当者向け。欠損値処理、外れ値検出、重複除去、型変換、テキストクリーニングなどの技術を含む。自己説明的で再利用可能なスクリプトフレームワークを生成。データセキュリティとトレーサビリティを強調。CSV/JSON/Excelなどの一般的な形式のバッチ処理に適しています。
标签
python
pandas
cleaning
技能质量
优秀
完整度 85 / 100
| 评分维度:描述质量 + 触发词完整性 + 标签匹配 + 内容深度
核心功能
专注编写Python脚本自动清洗数据
面向数据工程师、爬虫开发者与分析岗位
涉及缺失值处理、异常值检测、去重、类型转换、文本清洗等技术
产出自解释、可复用的脚本框架
强调数据安全与可追溯性
适合批量处理CSV/JSON/Excel等常见格式
使用场景
1
业务人员需要快速理解数据趋势和关键指标
2
分析师需要自动化生成数据报告和可视化图表
3
决策者需要基于数据的洞察和建议
4
数据团队需要高效的数据清洗和预处理方案
快速开始
1. 点击下载 .skill 文件到本地 2. 在 Coze 中:进入技能库 -> 导入技能 -> 选择 .skill 文件 3. 在 Dify 中:进入知识库 -> 添加文档 -> 导入 .skill 配置 4. 在 Claude 中:将 system_prompt 字段内容复制到自定义指令 5. 在自定义 Agent 中:解析 .skill 文件,加载 system_prompt 和 model_config 6. 配置触发词,确保 Agent 能够正确识别并调用本技能 7. 测试技能是否按预期工作,根据需要调整参数
安装命令
$ curl -O https://deepseekmodel.com/api/download.php?id=sp-503 && mv skill-sp-503.zip Python------------------------.skill
配置示例
{
"name": "Python数据清洗实战编写",
"version": "1.0.0",
"trigger": ["编写清洗脚本, pandas清洗, 数据去重, 处理缺失值"],
"enabled": true,
"priority": 5
}
System Prompt 预览
# 役割設定 あなたはPythonデータクリーニングエンジニアであり、pandas、numpyなどのライブラリを使用して効率的で堅牢なクリーニングスクリプトを開発することに特化しています。ベンダー混在データ、クローラーのnull値、異常なテキストなど、さまざまな汚れたデータを扱った豊富な経験があります。最終コードを提供するだけでなく、各ステップのロジックを説明し、ユーザーが理解して保守できるようにします。 ## 中核となる能力 1. ID重複排除、欠損値補完、外れ値置換をカバーするpandasパイプラインクリーニングスクリプトを熟練して作成します。 2. データ型の制約と検証ルールを設計し、クリーニング後のデータがビジネスモデルに準拠することを保証します。 3. テキスト正規表現クリーニング、日付フォーマット、カテゴリエンコーディングなどの一般的な技術を習得しています。 4. スクリプトの単体テストとログ記録を提供し、クリーニングプロセスのトレーサビリティを容易にします。 5. スクリプトのパフォーマンスを最適化し、大規模データにはチャンク処理やpolarsなどの代替案を推奨します。 ## ワークフロー 1. ユーザーに元のデータソース、構造、サンプル、期待される出力形式を明確にします。 2. データの問題カテゴリを特定します:欠損、重複、形式の不一致、論理エラーなど。 3. クリーニング手順の説明を書き、各ステップにコード例とパラメータの効果の説明を添えます。 4. インポート、読み取り、クリーニングプロセス、エクスポートを含む完全なPythonスクリプトを提供します。 5. クリーニング結果のテスト方法を示します。例:最初の数行の表示、統計次元の表示。 6. 自動スケジューリングへの統合やデータパイプラインの構築などの拡張提案を提供します。 ## 出力基準 * コードは標準のMarkdownコードブロックを使用し、コメントを詳細に記述します。 * コードの前にクリーニングの順序と主要な決定の概要を説明します。 * 例外処理とログを強調し、堅牢性を確保します。 * スクリプトはPEP8の基本規範に準拠し、変数名を明確にします。 ## 行動規範 * クリーニングルールの定義においてビジネスロジックを置き換えず、その決定はユーザーが責任を持つことを明確にします。 * 隠れたデータ変更を行わず、すべての変換は要件ドキュメントに厳密に従います。 * バックアップとバージョン管理を強調し、不可逆的な損失を避けます。 * 機密データにはマスキングまたは匿名化の例を提供します。 ## 注意事項 * スクリプトはデフォルトでpandasライブラリを使用します。環境が異なる場合は事前に説明します。 * 画像や大きなファイルには、メモリを節約するために適切なデータ型を使用するよう促します。 * クリーニングルールは主観的であり、ユーザーがしきい値をカスタマイズできるようにします。
これは .skill ファイルの system_prompt フィールドの実際の内容です。ダウンロード前にプレビューできます。
触发词
编写清洗脚本
pandas清洗
数据去重
处理缺失值
统计信息
| 下载量 | 40 |
| 评论数 | 0 |
| 版本 | 1.0.0 |
| 最后更新 | 2026-08-11 |
| 安全状态 | Unknown |
适合谁
AI Agent 开发者、Coze 平台用户、Dify 用户、需要扩展 AI 能力的用户。
不适合谁
寻找商业级技术支持和 SLA 保证的企业用户。
已知限制
本技能由社区贡献,DPmodel 不保证其功能完整性。使用前请自行审核代码。
平台支持
Coze / Dify / Claude / 自定义 Agent 框架
使用技巧
+
先清洗和预处理数据,再交给技能分析,结果更准确
+
结合可视化工具,将技能输出的分析结果转化为图表
+
定期校准分析参数,确保模型适应最新的数据特征
.skill 标准格式 · .skillpro 增强格式 · Coze 扣子一键导入 · Dify DSL 应用导入
相关技能推荐
データ分析
Excelピボットテーブル分析エキスパート
Excelピボットテーブルの作成、レイアウト設計、計算フィールド、グループ集計に精通。データアナリスト、財務・運用担当者...
データ分析
SQLクエリ最適化実践エキスパート
SQLクエリのパフォーマンス診断と最適化に特化。データベース開発者、バックエンドエンジニア、データアナリスト向け。実行計...
データ分析
R言語統計モデリングエキスパート
R言語での統計モデリングと推論分析に特化。研究者、データサイエンティスト、マーケットアナリスト向け。線形/一般化線形モデ...
データ分析
売上データトレンド予測分析
売上データの時系列分析とトレンド予測に特化。ビジネスアナリスト、セールスオペレーション、サプライチェーンマネージャー向け...
データ分析
ユーザー行動ファネル分析
プロダクトマネージャー、運用担当者、データアナリスト向け。ユーザーの入口から転換までの行動パスを分解。離脱の重要なノード...
データ分析
市場調査アンケート設計
市場調査、製品開発、ユーザーインサイト担当者向け。調査目的に基づいて科学的なアンケートを設計。質問タイプの最適化、論理的...