Skills Plugins MCP Prompt Model 博客 我的中心

最新博客文章

8 / 173

AI 开发实战教程,从零到一构建你的 AI 应用。

教程 日期
DeepSeek 数据工程教程 模型微调 高级 从数据采集到质量评估,完整掌握大模型数据工程流水线。涵盖 SFT 数据集构建、RLHF 偏好数据准备、数据清洗去重、数据增强、大规模数据处理等核心环节。 2025-06 ·23 分钟阅读 DeepSeek 模型架构深度解析 模型微调 高级 深入解析 DeepSeek-V3 的 MoE 架构、MLA 注意力机制、Multi-Token Prediction 等核心技术。理解 DeepSeek 如何以极低成本实现 GPT-4o 级别的性能,含架构图解和源码分析。 2025-06 ·28 分钟阅读 DeepSeek 微调实战教程 模型微调 高级 DeepSeek 模型微调全流程实战:LoRA/QLoRA 高效微调、全参数微调、数据准备、训练配置、评估验证。覆盖 DeepSeek-V3 和 DeepSeek-R1 的微调方案,含完整代码和最佳实践。 2025-06 ·26 分钟阅读 模型蒸馏实战:用大模型训练小模型 模型微调 高级 知识蒸馏让小模型逼近大模型能力,同时大幅降低推理成本。本文深入讲解蒸馏原理、数据生成策略、训练技巧与效果评估,教你用 DeepSeek 蒸馏出高性价比小模型。 2026-08 ·24 分钟阅读 RLHF 强化微调实战:从偏好数据到奖励模型 模型微调 高级 RLHF 让模型输出与人类偏好对齐。本文从偏好数据采集、奖励模型训练到 PPO 强化微调,完整复现一条 RLHF 实战链路,并给出数据质量与效果评估的工程经验。 2026-08 ·26 分钟阅读 模型评估与 A/B 测试 模型微调 高级 微调完成后,如何客观评估模型效果?A/B测试如何设计才能得到统计显著的结论?本文从离线评估、在线A/B测试和统计显著性三个维度,建立科学的模型效果评估体系。 2026-07 ·20 分钟阅读 DPO 偏好对齐训练详解 模型微调 高级 DPO(Direct Preference Optimization)是RLHF的简化替代方案,无需训练奖励模型。本文深入讲解DPO的原理、实现细节和训练技巧。 2026-07 ·25 分钟阅读 数据集构建与质量评估 模型微调 高级 数据质量决定了微调效果的上限。本文系统讲解微调数据集的构建方法、数据清洗策略、质量评估指标以及数据增强技术,帮助你构建高质量的微调数据集。 2025-06 ·17 分钟阅读

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。