Skills MCP Model 博客 提交 Skills
登录 注册

AI 开发 教程

系统化的 AI 开发学习路径。从提示词工程到模型微调,从 RAG 到 Agent 开发,覆盖 AI 应用开发全栈知识。共 98 篇教程,6 个分类,入门到高级全覆盖。

找到 6 篇教程

部署与运维 高级

DeepSeek 推理加速深度教程

全面掌握 DeepSeek 模型推理加速技术。vLLM、SGLang、TensorRT-LLM、llama.cpp 四大引擎深度对比,从部署到调优,从单卡到分布式,完整的推理加速方案。

推理加速 vLLM TensorRT 性能优化
2025-06 25 分钟阅读
阅读教程 →
部署与运维 高级

DeepSeek 性能调优教程

DeepSeek 性能调优完整指南:GPU 显存优化、批处理策略、量化技术、并发控制、延迟优化。含 profiling 工具使用、性能基准测试和最佳实践,实现吞吐量和延迟的最优平衡。

性能调优 GPU优化 量化 Profiling
2025-06 25 分钟阅读
阅读教程 →
部署与运维 高级

AI 应用的监控与可观测性

AI应用的可观测性远比传统应用复杂——需要监控LLM调用延迟、Token消耗、幻觉率、用户满意度等多维指标。本文构建一个完整的AI应用监控体系,涵盖指标采集、告警配置、成本追踪和质量监控。

AI运维 监控 可观测性 成本管理
2026-07 20 分钟阅读
阅读教程 →
部署与运维 高级

GPU 集群管理与调度

管理数十张GPU的集群需要专业的调度策略。本文讲解GPU资源管理、任务优先级调度、显存碎片整理和多租户隔离的实践经验。

GPU 集群管理 资源调度 NVIDIA
2026-07 23 分钟阅读
阅读教程 →
部署与运维 高级

GPU 加速推理优化深度指南

GPU 推理优化是降低大模型部署成本的关键。本文深入讲解 FlashAttention、量化推理、TensorRT 加速、连续批处理等核心技术,帮助你最大化 GPU 利用率。

GPU优化 FlashAttention TensorRT 量化推理
2025-07 19 分钟阅读
阅读教程 →
部署与运维 高级

大模型API服务化最佳实践

将大模型能力API化是企业级应用的关键环节。本文从架构设计、限流策略、缓存优化、安全防护等维度,系统讲解大模型API服务化的最佳实践。

API服务化 架构设计 限流 安全
2025-06 20 分钟阅读
阅读教程 →

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

完全免费,取消任意时间。我们不会发送垃圾邮件。