Skills Plugins MCP Prompt Model 博客 我的中心

agent-eval

カスタムタスクでコーディングエージェント(Claude Code、Aider、Codex など)をヘッドツーヘッドで比較し、合格率、コスト、時間、一貫性のメトリクスを測定します

DeepseekModel 官方收录技能 质量 优秀 · 90 v1.0.0

获取

https://deepseekmodel.com/api/download.php?id=affaan-m-ecc-docs-ja-jp-skills-agent-eval-skill-md&format=skill
下载 .skill 标准格式,含 system_prompt 与 model_config,导入任意 Agent 框架即可使用
.skill 文件中 system_prompt 字段的实际内容。
name agent-eval description カスタムタスクでコーディングエージェント(Claude Code、Aider、Codex など)をヘッドツーヘッドで比較し、合格率、コスト、時間、一貫性のメトリクスを測定します origin ECC tools Read, Write, Edit, Bash, Grep, Glob エージェント評価スキル 再現可能なタスクでコーディングエージェントをヘッドツーヘッドで比較するための軽量 CLI ツールです。「どのコーディングエージェントが最適か?」という比較はすべて感覚に頼りがちです — このツールはそれを体系化します。 起動タイミング 自分のコードベースでコーディングエージェント(Claude Code、Aider、Codex など)を比較する 新しいツールやモデルを採用する前にエージェントパフォーマンスを測定する エージェントがモデルやツールを更新した際にリグレッションチェックを実行する チームにデータに基づいたエージェント選択の判断を提供する インストール 注意: agent-eval はソースを確認した後、リポジトリからインストールしてください。 コアコンセプト YAML タスク定義 タスクを宣言的に定義します。各タスクは何をするか、どのファイルを操作するか、成功をどう判定するかを指定します: name: add-retry-logic description: Add exponential backoff retry to the HTTP client repo: ./my-project files: - src/http_client.py prompt: | Add retry logic with exponential backoff to all HTTP requests. Max 3 retries. Initial delay 1s, max delay 30s. judge: - type: pytest command: pytest tests/test_http_client.py -v - type: grep pattern: "exponential_backoff|retry" files: src/http_client.py commit: "abc1234" # 再現性のために特定コミットに固定 Git ワークツリー分離 各エージェント実行は独自の git ワークツリーを取得します — Docker 不要。これにより再現性の分離が提供され、エージェントが互いに干渉したりベースリポジトリを破壊したりしません。 収集メトリクス メトリクス 測定内容 合格率 エージェントはジャッジをパスするコードを生成できたか? コスト タスクあたりの API 費用(利用可能な場合) 時間 完了までのウォールクロック秒数 一貫性 繰り返し実行での合格率(例:3/3 = 100%) ワークフロー 1. タスクの定義 タスクごとに 1 つの YAML ファイルを持つ tasks/ ディレクトリを作成します: mkdir tasks # タスク定義を作成(上記のテンプレートを参照) 2. エージェントの実行 タスクに対してエージェントを実行します: agent-eval run --task tasks/add-retry-logic.yaml --agent claude-code --agent aider --runs 3 各実行: 指定されたコミットから新しい git ワークツリーを作成 エージェントにプロンプトを渡す ジャッジ基準を実行 合格・不合格、コスト、時間を記録 3. 結果の比較 比較レポートを生成します: agent-eval report --format table Task: add-retry-logic (3 runs each) ┌──────────────┬───────────┬────────┬────────┬─────────────┐ │ Agent │ Pass Rate │ Cost │ Time │ Consistency │ ├──────────────┼───────────┼────────┼────────┼─────────────┤ │ claude-code │ 3/3 │ $0.12 │ 45s │ 100% │ │ aider │ 2/3 │ $0.08 │ 38s │ 67% │ └──────────────┴───────────┴────────┴────────┴─────────────┘ ジャッジタイプ コードベース(決定論的) judge: - type: pytest command: pytest tests/ -v - type: command command: npm run build パターンベース judge: - type: grep pattern: "class.*Retry" files: src/**/*.py モデルベース(LLM-as-judge) judge: - type: llm prompt: | Does this implementation correctly handle exponential backoff? Check for: max retries, increasing delays, jitter. ベストプラクティス 3〜5 タスクから始める — おもちゃの例ではなく、実際のワークロードを代表するタスク エージェントごとに少なくとも 3 試行実行する — エージェントは非決定論的なので分散を把握する タスク YAML でコミットを固定する — 日や週をまたいで結果が再現可能になる タスクごとに少なくとも 1 つの決定論的ジャッジを含める (テスト、ビルド)— LLM ジャッジはノイズを加える 合格率と一緒にコストを追跡する — 10 倍のコストで 95% のエージェントが正しい選択でない場合もある タスク定義をバージョン管理する — それらはテストフィクスチャであり、コードとして扱う リンク リポジトリ: github.com/joaquinhuigomez/agent-eval
Agent 识别该技能的关键词,点击任意一个即可复制。

该技能未提供触发词。

下载的 .skill 包内含以下字段。
字段 说明
format格式标识(skill/v1)
skill_id技能唯一 ID
name技能名称
version版本号
description技能描述
category所属分类(数组)
trigger_words触发词列表
tags标签列表
source来源标识
source_url来源链接(本页地址)
exported_at导出时间(每次下载生成)
system_prompt系统提示词正文
model_config模型参数:provider / model / temperature / max_tokens / top_p
examples示例
install_guide各平台导入说明(Coze / Dify / Claude / 自定义框架)
同一份技能可按不同平台格式导出。
.skill 标准格式,含 system_prompt 与 model_config,导入任意 Agent 框架即可使用 下载
.skillpro 增强格式,额外含脚本 / 工具 / 依赖 / 钩子占位 下载
.json 纯 JSON 导出,只含 system_prompt 与模型参数 下载
Coze 带 frontmatter 的 Markdown,Coze 平台导入用 下载
Dify Dify DSL,创建应用后直接导入 下载

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

验证码 --

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。