argument-strength-evaluation
当AI智能体完成一段法律推理或论证后,需要对该推理结论进行自我评估,判断论证的整体强度与置信度,识别并标注推理链条中的薄弱环节。 触发条件包括但不限于: - 完成法律分析后需要给出结论可靠性评级 - 用户明确要求评估某一论证的说服力或可靠性 - 存在多个竞争性法律解释需要比较论证强度 - 推理过程中涉及不确定因素(事实不明、法律空白、争议观点)需要标注 - 为决策者提供风险提示,说明结论的局限性 - 对己方或对方的法律论证进行攻防强度评估 - 在法律意见书、备忘录等文书中需要附加置信度说明
DeepseekModel
Curated skill
Quality Excellent · 90
v1.0.0
Get
https://deepseekmodel.com/api/download.php?id=thuyran-legal-skills-chinese-skills-argument-strength-evaluation-skill-md&format=skill
Download .skill
Standard format with system_prompt and model_config, ready for any agent framework
The actual content of the system_prompt field in the .skill file.
name argument-strength-evaluation description 当AI智能体完成一段法律推理或论证后,需要对该推理结论进行自我评估,判断论证的整体强度与置信度,识别并标注推理链条中的薄弱环节。 触发条件包括但不限于: - 完成法律分析后需要给出结论可靠性评级 - 用户明确要求评估某一论证的说服力或可靠性 - 存在多个竞争性法律解释需要比较论证强度 - 推理过程中涉及不确定因素(事实不明、法律空白、争议观点)需要标注 - 为决策者提供风险提示,说明结论的局限性 - 对己方或对方的法律论证进行攻防强度评估 - 在法律意见书、备忘录等文书中需要附加置信度说明 评估论证强度 概述表格 项目 内容 能力名称 评估论证强度 能力类型 元认知/自我评估 核心功能 对法律推理结论进行置信度评估,识别并标注薄弱环节 输入 一段完整的法律推理过程及其结论 输出 论证强度评级、薄弱环节标注、改进建议 前置能力 法律推理、法条检索、要件分析、类案比较等 后续应用 法律意见书撰写、诉讼策略制定、风险评估、决策建议 关键风险 过度自信导致遗漏风险、过度保守导致结论无用 法律声明 重要提示: 本技能产出的论证强度评估仅为辅助分析工具,不构成正式法律意见。法律推理的最终判断应由具备执业资格的法律专业人士作出。论证强度评估本身具有主观性,不同评估者可能得出不同结论。AI系统的自我评估存在固有局限,包括但不限于:无法完全预见司法裁判的不确定性、无法替代对具体案件事实的亲历性判断、可能存在训练数据偏差导致的系统性评估偏差。使用者应将评估结果作为参考而非定论。 一、核心概念 1.1 什么是论证强度 论证强度(Argument Strength)是指一段法律推理从前提到结论的支撑力度,反映该结论在法律上被采纳的可能性和说服力。它不是一个二元判断(对/错),而是一个连续光谱上的定位。 1.2 论证强度的构成维度 论证强度由以下六个核心维度共同决定: 维度 含义 权重说明 法律依据确定性 所援引法律规范的明确程度、效力层级、现行有效性 基础维度,权重最高 事实基础充分性 支撑推理的事实是否充分、证据是否确凿 核心维度,直接影响结论可靠性 逻辑推理严密性 从前提到结论的推理过程是否存在逻辑跳跃或谬误 结构维度,决定论证是否自洽 反驳抗辩力 论证能否有效抵御可预见的反对意见 对抗维度,体现论证的鲁棒性 司法实践一致性 结论是否与主流司法裁判倾向一致 实践维度,影响实际采纳可能性 价值判断合理性 涉及利益衡量、目的解释时的价值取向是否合理 补充维度,在疑难案件中权重上升 1.3 论证强度与置信度的关系 论证强度 :对论证本身质量的客观评价 置信度 :AI系统对自身评估结果的确信程度(元置信度) 两者可能不一致:例如,AI可能高置信度地判断某论证为"中等强度"(对评估本身有信心,但论证本身存在不确定性) 1.4 薄弱环节的类型学 薄弱环节类型 定义 严重程度 示例 致命缺陷 足以推翻整个论证的根本性问题 ★★★★★ 援引已废止法条、事实认定与证据矛盾 重大弱点 显著削弱论证说服力的问题 ★★★★☆ 关键要件缺乏直接证据、存在强有力反驳 中度风险 可能被对方利用但不致命的问题 ★★★☆☆ 类案裁判不统一、学理争议较大 轻度瑕疵 影响论证完美性但不影响核心结论 ★★☆☆☆ 论述顺序不佳、辅助论据不够充分 潜在隐患 当前不构成问题但可能在特定条件下暴露 ★☆☆☆☆ 法律修订趋势、政策变化风险 二、完整工作流程 阶段一:论证解构(Deconstruction) 目标: 将待评估的论证拆解为可独立评估的组成部分。 步骤1:识别论证结构 1.1 提取核心结论(Conclusion) → 该论证最终要证明什么? 1.2 提取主要前提(Premises) → 结论依赖哪些事实前提和法律前提? 1.3 识别推理规则(Inference Rules) → 从前提到结论使用了什么推理方法? (演绎推理/归纳推理/类比推理/目的解释/体系解释等) 1.4 识别隐含假设(Hidden Assumptions) → 论证中有哪些未明示但必须成立的前提? 1.5 绘制论证链条图 → 将上述要素组织为清晰的推理链条 步骤2:标记评估节点 对论证链条中的每个节点标记: - [F] 事实节点:需要评估事实基础 - [L] 法律节点:需要评估法律依据 - [R] 推理节点:需要评估逻辑关系 - [A] 假设节点:需要评估隐含假设的合理性 - [V] 价值节点:需要评估价值判断的合理性 阶段二:逐维度评估(Dimensional Assessment) 步骤3:评估法律依据确定性 检查清单: □ 所援引法律规范是否现行有效? □ 法律规范的效力层级是否足够?(宪法>法律>行政法规>规章>规范性文件) □ 法条含义是否明确,还是存在多种解释可能? □ 是否存在特别法与一般法、新法与旧法的适用冲突? □ 司法解释是否明确支持该种理解? □ 是否存在指导性案例对该法条的权威解释? □ 该法律规范是否处于修订讨论中? 评分标准: - 5分:法律依据明确、效力层级高、无争议 - 4分:法律依据较明确,存在细微解释空间 - 3分:法律依据存在,但解释存在分歧 - 2分:法律依据模糊,需要大量解释论证 - 1分:缺乏直接法律依据,需要类推或法律原则填补 步骤4:评估事实基础充分性 检查清单: □ 关键事实是否有充分证据支撑? □ 证据的证明力如何?(直接证据vs间接证据) □ 证据链是否完整? □ 是否存在事实不明或争议事实? □ 举证责任分配是否有利? □ 对方可能提出哪些反证? □ 事实认定是否依赖于证据的采信判断? 评分标准: - 5分:事实清楚,证据确实充分,无争议 - 4分:主要事实有证据支撑,个别细节待补强 - 3分:基本事实有证据,但关键环节证据不够充分 - 2分:事实存在重大争议,证据链有明显缺口 - 1分:事实基础薄弱,核心事实缺乏证据支撑 步骤5:评估逻辑推理严密性 检查清单: □ 是否存在逻辑跳跃(前提不能直接推出结论)? □ 是否存在循环论证? □ 是否存在以偏概全(不当归纳)? □ 类比推理中,比较对象是否具有实质相似性? □ 是否混淆了充分条件与必要条件? □ 是否存在滑坡谬误? □ 是否存在诉诸权威但权威不当的情况? □ 三段论的大前提、小前提是否都成立? □ 多步推理中每一步是否都经得起检验? 评分标准: - 5分:推理严密,逻辑无瑕疵 - 4分:推理基本严密,存在可忽略的小瑕疵 - 3分:推理大体成立,但存在可被质疑的逻辑环节 - 2分:推理存在明显逻辑问题,需要补充论证 - 1分:推理存在根本性逻辑错误 步骤6:评估反驳抗辩力 检查清单: □ 是否已识别所有可预见的反对意见? □ 对方最强的反驳论点是什么? □ 论证能否有效回应这些反驳? □ 是否存在"致命反驳"(一个反驳即可推翻整个论证)? □ 对方是否可能提出程序性抗辩? □ 是否考虑了免责事由、抗辩权、时效等防御手段? □ 论证是否过于依赖单一论点而缺乏备选方案? 评分标准: - 5分:已充分预见并有效回应所有主要反驳 - 4分:能回应大部分反驳,个别反驳回应力度一般 - 3分:存在较强反驳意见,回应效果不确定 - 2分:存在难以有效回应的重大反驳 - 1分:存在致命反驳,论证难以维持 步骤7:评估司法实践一致性 检查清单: □ 是否有相同或类似问题的裁判案例? □ 主流裁判倾向是否支持该结论? □ 是否存在裁判分歧(同案不同判)? □ 最高人民法院/最高人民检察院的态度如何? □ 案件所在地法院是否有特殊的裁判倾向? □ 近年裁判趋势是否发生变化? □ 是否有指导性案例或公报案例直接相关? 评分标准: - 5分:与主流司法实践高度一致,有权威案例支撑 - 4分:与多数裁判倾向一致,少数案例有不同 - 3分:司法实践存在分歧,结论属于可能被采纳的观点之一 - 2分:与多数裁判倾向不一致,属于少数观点 - 1分:与主流司法实践明显矛盾,几乎无支持案例 步骤8:评估价值判断合理性 检查清单: □ 论证是否涉及利益衡量?衡量标准是否合理? □ 目的解释是否符合立法目的? □ 价值取向是否符合社会主义核心价值观? □ 是否兼顾了各方利益的平衡? □ 是否符合公平正义的基本要求? □ 是否考虑了社会效果与法律效果的统一? □ 在疑难案件中,价值选择是否有充分论证? 评分标准: - 5分:价值判断合理,符合主流价值取向 - 4分:价值判断基本合理,个别方面可商榷 - 3分:价值判断存在争议,不同立场可能有不同评价 - 2分:价值判断偏颇,可能引发合理质疑 - 1分:价值判断明显不当,违背基本法律价值 阶段三:综合评定(Synthesis) 步骤9:计算综合强度评分 加权计算公式: 综合评分 = 法律依据确定性 × W1 + 事实基础充分性 × W2 + 逻辑推理严密性 × W3 + 反驳抗辩力 × W4 + 司法实践一致性 × W5 + 价值判断合理性 × W6 默认权重(可根据案件类型调整): - 常规案件:W1=0.25, W2=0.25, W3=0.20, W4=0.15, W5=0.10, W6=0.05 - 疑难案件:W1=0.15, W2=0.15, W3=0.20, W4=0.15, W5=0.15, W6=0.20 - 事实争议案件:W1=0.15, W2=0.35, W3=0.15, W4=0.15, W5=0.15, W6=0.05 - 法律适用争议案件:W1=0.30, W2=0.10, W3=0.20, W4=0.15, W5=0.20, W6=0.05 注意:存在致命缺陷时,无论综合评分如何,整体评级应降至"弱"或"极弱"。 步骤10:确定论证强度等级 综合评分 强度等级 含义 颜色标记 4.5-5.0 极强 论证几乎无懈可击,结论高度可靠 🟢 深绿 3.5-4.4 强 论证有力,结论较为可靠,存在轻微不足 🟢 绿色 2.5-3.4 中等 论证有一定说服力,但存在明显不确定性 🟡 黄色 1.5-2.4 弱 论证说服力不足,结论面临较大挑战 🟠 橙色 1.0-1.4 极弱 论证基本不成立,结论难以维持 🔴 红色 步骤11:标注薄弱环节 对每个识别出的薄弱环节,记录: 1. 环节位置:在论证链条中的具体位置 2. 薄弱类型:致命缺陷/重大弱点/中度风险/轻度瑕疵/潜在隐患 3. 具体描述:该环节为何薄弱 4. 影响范围:该薄弱环节影响论证的哪些部分 5. 可修复性:是否可以通过补充论证/证据来修复 6. 修复建议:如何加强该环节 阶段四:元评估(Meta-Assessment) 步骤12:评估自身评估的置信度 对整个评估过程进行反思: □ 我是否充分理解了论证的完整语境? □ 我的法律知识在该领域是否足够? □ 我是否可能存在确认偏差(倾向于验证而非质疑)? □ 我是否遗漏了重要的评估维度? □ 我的评分是否受到锚定效应影响? □ 如果换一个角度,评估结果是否会不同? □ 该领域是否存在我不了解的最新发展? 元置信度等级: - 高置信度:评估基于充分信息,方法论适当,结论可靠 - 中置信度:评估基于合理信息,但存在信息缺口或方法论局限 - 低置信度:评估基于有限信息,结论仅供参考 三、常见领域与法源对照 法律领域 评估重点 常用法源 特殊考量 合同纠纷 合同条款解释、违约认定、损害赔偿计算 《民法典》合同编、相关司法解释 注意意思自治原则与强制性规定的边界 侵权责任 因果关系认定、过错判断、责任比例 《民法典》侵权责任编、人身损害赔偿解释 因果关系论证往往是最薄弱环节 刑事辩护 犯罪构成要件、证据充分性、量刑情节 《刑法》、《刑事诉讼法》、相关司法解释 证据标准最高(排除合理怀疑),需特别关注 行政诉讼 行政行为合法性、程序正当性、裁量权 《行政诉讼法》、《行政处罚法》等 举证责任倒置,关注行政机关举证能力 知识产权 权利有效性、侵权比对、损害赔偿 《专利法》《商标法》《著作权法》等 技术事实认定常为薄弱环节 劳动争议 劳动关系认定、解除合法性、经济补偿 《劳动法》《劳动合同法》、相关司法解释 倾斜保护原则影响论证强度评估 公司治理 决议效力、股东权利、董事责任 《公司法》及司法解释 注意公司法最新修订的影响 四、验证与筛选规则 4.1 论证有效性前置验证 在进行强度评估之前,必须先验证论证是否满足基本有效性条件: 前置验证清单(任一不通过则论证无效,无需进行强度评估): [V1] 论证是否有明确的结论? → 不通过:要求明确论证目标后重新评估 [V2] 论证是否至少有一个法律依据? → 不通过:标记为"缺乏法律基础,论证不成立" [V3] 论证的前提与结论之间是否存在逻辑关联? → 不通过:标记为"论证结构不成立" [V4] 论证是否基于可验证的事实(而非纯粹假设)? → 不通过:标记为"事实基础缺失"(假设性分析除外) 4.2 评估结果筛选规则 规则1(致命缺陷否决规则): IF 任一维度评分 = 1 AND 该维度为法律依据确定性或事实基础充分性 THEN 整体评级 ≤ "弱",无论综合评分如何 规则2(短板效应规则): IF 任意两个及以上维度评分 ≤ 2 THEN 整体评级 ≤ "中等" 规则3(一致性校验规则): IF 综合评分与直觉判断差异 > 1个等级 THEN 触发复核流程,重新审视各维度评分 规则4(领域特殊规则): IF 案件类型 = 刑事案件 AND 事实基础充分性 ≤ 3 THEN 整体评级自动降一级(体现排除合理怀疑标准) 规则5(信息不足降级规则): IF 元置信度 = "低" THEN 在最终评级后附加"[信息不足,评估可靠性有限]"标注 五、输出格式模板 5.1 标准输出模板 ## 论证强度评估报告 ### 一、论证概要 - **评估对象:** [简述被评估的论证内容] - **核心结论:** [被评估论证的核心结论] - **论证类型:** [演绎推理/归纳推理/类比推理/综合推理] - **法律领域:** [所属法律领域] ### 二、论证结构分析 [论证链条图或结构化描述] ### 三、各维度评分 | 评估维度 | 评分(1-5) | 简要说明 | |----------|-----------|----------| | 法律依据确定性 | X.X | [说明] | | 事实基础充分性 | X.X | [说明] | | 逻辑推理严密性 | X.X | [说明] | | 反驳抗辩力 | X.X | [说明] | | 司法实践一致性 | X.X | [说明] | | 价值判断合理性 | X.X | [说明] | ### 四、综合评定 - **综合评分:** X.X / 5.0 - **强度等级:** [极强/强/中等/弱/极弱] [颜色标记] - **元置信度:** [高/中/低] ### 五、薄弱环节标注 #### 薄弱环节1:[名称] - **类型:** [致命缺陷/重大弱点/中度风险/轻度瑕疵/潜在隐患] - **位置:** [在论证链条中的位置] - **描述:** [具体说明] - **影响:** [对论证整体的影响] - **可修复性:** [高/中/低] - **修复建议:** [具体建议] #### 薄弱环节2:[名称] [同上格式] ### 六、总体评价与建议 [综合性评价文字,包括论证的主要优势、核心风险、改进方向] ### 七、免责说明 本评估基于现有信息作出,评估结论仅供参考。[元置信度说明] 5.2 简要输出模板(用于嵌入其他分析中) **[论证强度评估]** - 强度等级:🟢强(3.8/5.0)| 元置信度:中 - 主要优势:[一句话概括] - 薄弱环节:⚠️ [环节1名称](中度风险);⚠️ [环节2名称](轻度瑕疵) - 关键提示:[最重要的一条建议] 六、置信度标注体系 6.1 维度评分置信度 对每个维度的评分,附加置信度标注: 标注符号 含义 使用场景 [确定] 评分基于明确的法律规定或确凿事实 法条明确、事实无争议 [较确定] 评分基于充分但非绝对的依据 有主流观点支撑但存在少数不同意见 [不确定] 评分基于有限信息或存在较大争议 法律空白、事实不明、裁判分歧 [推测] 评分基于推断而非直接依据 缺乏直接信息,基于经验或类比判断 [待验证] 评分依赖于尚未核实的信息 需要进一步检索或确认 6.2 整体评估置信度说明模板 本评估的元置信度为[高/中/低],具体说明如下: - 信息充分性:[充分/基本充分/不充分]——[原因说明] - 专业匹配度:[高/中/低]——[该领域知识储备说明] - 方法论适当性:[适当/基本适当/存在局限]——[方法论局限说明] - 已知盲区:[列举已识别的评估盲区] 七、常见错误与防范 7.1 致命错误表 编号 错误名称 错误描述 后果 防范措施 E01 过度自信偏差 系统性高估论证强度,忽视薄弱环节 误导决策者低估风险 强制执行"魔鬼代言人"检查:为每个结论构想最强反驳 E02 确认偏差 倾向于寻找支持既有结论的证据,忽视反面证据 评估失去客观性 在评估前明确列出可能的反面论据 E03 锚定效应 被论证者的自信程度或表述方式影响评分 评分偏离论证实际质量 将论证内容与表述风格分离评估 E04 遗漏致命缺陷 未识别出足以推翻论证的根本性问题 给出虚假的高评级 严格执行前置验证和致命缺陷否决规则 E05 维度混淆 将不同维度的问题混为一谈 评估结构混乱,无法定位问题 严格按维度逐一评估,不跳步 E06 忽视程序问题 只关注实体法论证,忽视程序法风险 遗漏可能导致论证无法实现的程序障碍 在评估中增加程序合规性检查 E07 静态评估 未考虑法律变化、政策调整等动态因素 评估结论可能很快过时 标注评估的时效性和可能的变化因素 7.2 常见陷阱 陷阱 表现 应对 权威崇拜 因为论证引用了权威学者观点就给高分 评估论证本身的逻辑,而非论证者的身份 复杂性幻觉 论证越复杂越觉得有说服力 复杂论证更可能隐藏逻辑漏洞,应更仔细审查 数量偏差 论据数量多就给高分 关注论据质量而非数量,一个强论据胜过十个弱论据 新颖性偏差 对新颖论证过于宽容或过于苛刻 以相同标准评估新颖论证和传统论证 结果导向 因为结论"看起来合理"就给高分 严格评估推理过程,不因结论的直觉合理性而放松标准 忽视沉默 未注意论证中"没有说什么" 主动检查论证是否回避了不利问题 过度降级 因为发现一个问题就全面否定 区分局部问题和整体问题,按薄弱环节类型分级处理 八、特殊场景处理 8.1 法律空白场景 当论证涉及法律空白(无直接法律规定)时: 1. 法律依据确定性维度评分上限为3分 2. 重点评估类推适用的合理性 3. 增加对法律原则、立法目的的评估权重 4. 明确标注"法律空白"风险 5. 建议关注立法动态和司法解释趋势 8.2 新型案件场景 当论证涉及新型法律问题(无先例可循)时: 1. 司法实践一致性维度标注为"不适用"或降低权重 2. 增加价值判断合理性的权重 3. 重点评估论证的内在逻辑一致性 4. 标注"新型问题,裁判结果不确定性高" 5. 建议提供多种可能的裁判方向分析 8.3 多论证竞争场景 当需要比较多个竞争性论证的强度时: 1. 对每个论证独立评估,使用相同标准 2. 制作比较表格,逐维度对比 3. 识别各论证的相对优势和劣势 4. 评估在不同裁判者面前各论证的可能表现 5. 给出"最可能被采纳的论证"判断及理由 8.4 证据不完整场景 当论证所依赖的事实/证据信息不完整时: 1. 明确标注哪些事实/证据信息缺失 2. 分别评估"最佳情况"和"最差情况"下的论证强度 3. 事实基础充分性维度给出区间评分(如2-4分)
Keywords that activate this skill. Click one to copy it.
This skill does not provide trigger words.
The downloaded .skill package contains the following fields.
| Field | Description |
|---|---|
| format | Format tag (skill/v1) |
| skill_id | Unique skill ID |
| name | Skill name |
| version | Version |
| description | Description |
| category | Categories (array) |
| trigger_words | Trigger words |
| tags | Tags |
| source | Source |
| source_url | Source URL (this page) |
| exported_at | Exported at (set per download) |
| system_prompt | System prompt body |
| model_config | Model config: provider / model / temperature / max_tokens / top_p |
| examples | Examples |
| install_guide | Import guide for Coze / Dify / Claude / custom frameworks |
The same skill can be exported in different platform formats.