Skills MCP Model 博客 提交 Skills
登录 注册

AI 开发 教程

系统化的 AI 开发学习路径。从提示词工程到模型微调,从 RAG 到 Agent 开发,覆盖 AI 应用开发全栈知识。共 98 篇教程,6 个分类,入门到高级全覆盖。

找到 16 篇教程

部署与运维 高级

DeepSeek 推理加速深度教程

全面掌握 DeepSeek 模型推理加速技术。vLLM、SGLang、TensorRT-LLM、llama.cpp 四大引擎深度对比,从部署到调优,从单卡到分布式,完整的推理加速方案。

推理加速 vLLM TensorRT 性能优化
2025-06 25 分钟阅读
阅读教程 →
部署与运维 入门

DeepSeek 模型选型与部署指南

DeepSeek 全系列模型详解:V3、R1、Coder、VL2 等模型的能力特点、适用场景和部署方案。从模型选型到生产部署的完整指南,含 API 调用和本地部署教程。

模型选型 DeepSeek-V3 DeepSeek-R1 部署
2025-06 20 分钟阅读
阅读教程 →
部署与运维 进阶

DeepSeek 部署与运维教程

DeepSeek 模型部署全流程:vLLM 部署配置、负载均衡、自动扩缩容、监控告警、成本优化。含 Docker、Kubernetes 部署方案和云平台部署指南,覆盖单机到集群的全场景。

部署 vLLM Docker Kubernetes
2025-06 24 分钟阅读
阅读教程 →
部署与运维 高级

DeepSeek 性能调优教程

DeepSeek 性能调优完整指南:GPU 显存优化、批处理策略、量化技术、并发控制、延迟优化。含 profiling 工具使用、性能基准测试和最佳实践,实现吞吐量和延迟的最优平衡。

性能调优 GPU优化 量化 Profiling
2025-06 25 分钟阅读
阅读教程 →
部署与运维 入门

DeepSeek 模型下载与安装

DeepSeek 模型下载与安装完整指南:Hugging Face 下载、Ollama 一键部署、量化版本选择、显存需求评估。含所有 DeepSeek 模型的下载链接、安装步骤和验证方法。

模型下载 Ollama HuggingFace 安装教程
2025-06 18 分钟阅读
阅读教程 →
部署与运维 进阶

DeepSeek 模型本地部署完全指南

云端API虽好,但很多场景需要本地部署——数据安全、低延迟、离线使用。本文全面讲解DeepSeek模型的本地部署方案,涵盖Ollama、vLLM、llama.cpp等主流工具,从硬件选型到性能调优全覆盖。

DeepSeek 本地部署 Ollama vLLM 模型运维
2026-07 25 分钟阅读
阅读教程 →
部署与运维 高级

AI 应用的监控与可观测性

AI应用的可观测性远比传统应用复杂——需要监控LLM调用延迟、Token消耗、幻觉率、用户满意度等多维指标。本文构建一个完整的AI应用监控体系,涵盖指标采集、告警配置、成本追踪和质量监控。

AI运维 监控 可观测性 成本管理
2026-07 20 分钟阅读
阅读教程 →
部署与运维 进阶

AI API 成本优化实战

AI API的token费用看似便宜,但规模化后成本可能失控。本文从提示词压缩、语义缓存、模型路由、批处理等维度出发,系统讲解AI API成本优化的实战策略,帮你的月度账单降低50%-80%。

成本优化 API 缓存 Token管理
2026-07 17 分钟阅读
阅读教程 →
部署与运维 进阶

AI 服务容器化最佳实践

将AI模型服务容器化是生产部署的第一步。本文讲解Docker镜像优化、GPU支持、健康检查和Kubernetes部署的完整方案。

Docker Kubernetes 容器化 AI部署
2026-07 22 分钟阅读
阅读教程 →
部署与运维 进阶

CI/CD 流水线中的 AI 测试

将AI模型测试集成到CI/CD流水线是持续交付高质量AI服务的关键。本文讲解自动评估、回归测试、性能基准和部署门禁的完整方案。

CI/CD AI测试 自动化测试 持续集成
2026-07 20 分钟阅读
阅读教程 →
部署与运维 高级

GPU 集群管理与调度

管理数十张GPU的集群需要专业的调度策略。本文讲解GPU资源管理、任务优先级调度、显存碎片整理和多租户隔离的实践经验。

GPU 集群管理 资源调度 NVIDIA
2026-07 23 分钟阅读
阅读教程 →
部署与运维 高级

GPU 加速推理优化深度指南

GPU 推理优化是降低大模型部署成本的关键。本文深入讲解 FlashAttention、量化推理、TensorRT 加速、连续批处理等核心技术,帮助你最大化 GPU 利用率。

GPU优化 FlashAttention TensorRT 量化推理
2025-07 19 分钟阅读
阅读教程 →
部署与运维 进阶

大模型推理加速技术全景

推理速度直接决定用户体验。本文系统讲解 KV Cache、Speculative Decoding、模型量化、算子融合等推理加速技术,帮助你从原理到实践全面掌握大模型推理优化。

推理加速 KV Cache 投机解码 算子融合
2025-07 17 分钟阅读
阅读教程 →
部署与运维 高级

大模型API服务化最佳实践

将大模型能力API化是企业级应用的关键环节。本文从架构设计、限流策略、缓存优化、安全防护等维度,系统讲解大模型API服务化的最佳实践。

API服务化 架构设计 限流 安全
2025-06 20 分钟阅读
阅读教程 →
部署与运维 进阶

vLLM高性能推理部署

vLLM是当前最先进的开源大模型推理引擎。本文深入讲解vLLM的PagedAttention原理、生产环境配置、性能调优策略和监控方案,帮助你构建高吞吐量的推理服务。

vLLM 推理引擎 性能优化
2025-05 18 分钟阅读
阅读教程 →
部署与运维 入门

大模型本地部署方案对比

本地部署大模型是保障数据安全和控制成本的关键方案。本文对比Ollama、vLLM、llama.cpp等主流部署方案,从易用性、性能、硬件需求等维度帮助你做出选择。

本地部署 Ollama llama.cpp 部署方案
2025-03 15 分钟阅读
阅读教程 →

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

完全免费,取消任意时间。我们不会发送垃圾邮件。