最新博客文章
22 / 173AI 开发实战教程,从零到一构建你的 AI 应用。
全部173
入门32
进阶86
高级55
全部
提示词工程12
RAG检索增强16
Agent开发31
模型微调18
部署与运维22
AI应用开发33
DeepSeek API16
多模态开发3
AI 安全3
模型推理1
检索系统1
RAG检索1
模型架构1
API 开发1
Agent 开发10
模型部署1
多模态1
模型评测2
教程
日期
DeepSeek 推理加速深度教程
部署与运维
高级
全面掌握 DeepSeek 模型推理加速技术。vLLM、SGLang、TensorRT-LLM、llama.cpp 四大引擎深度对比,从部署到调优,从单卡到分布式,完整的推理加速方案。
DeepSeek 模型选型与部署指南
部署与运维
入门
DeepSeek 全系列模型详解:V3、R1、Coder、VL2 等模型的能力特点、适用场景和部署方案。从模型选型到生产部署的完整指南,含 API 调用和本地部署教程。
DeepSeek 部署与运维教程
部署与运维
进阶
DeepSeek 模型部署全流程:vLLM 部署配置、负载均衡、自动扩缩容、监控告警、成本优化。含 Docker、Kubernetes 部署方案和云平台部署指南,覆盖单机到集群的全场景。
DeepSeek 性能调优教程
部署与运维
高级
DeepSeek 性能调优完整指南:GPU 显存优化、批处理策略、量化技术、并发控制、延迟优化。含 profiling 工具使用、性能基准测试和最佳实践,实现吞吐量和延迟的最优平衡。
DeepSeek 模型下载与安装
部署与运维
入门
DeepSeek 模型下载与安装完整指南:Hugging Face 下载、Ollama 一键部署、量化版本选择、显存需求评估。含所有 DeepSeek 模型的下载链接、安装步骤和验证方法。
DeepSeek Harness 安装与首次启动:npx、全局安装与源码构建三条路径
部署与运维
入门
三种安装方式(npx 临时运行 / npm 全局安装 / 源码构建)、dsh web 与 headless 的差异、Web UI 首次配置流程、工作目录权限三档,以及官方预设提供方与自定义 OpenAI 兼容端点的完整配置步骤与排错清单。
插件配置与 Bundle / Profile 分层:dsh 的生效配置到底从哪来
部署与运维
高级
dsh 的配置是分层叠加的:插件 schema 默认值、Profile、Bundle、用户覆盖与命令行 patch。本文用 dsh --dump-config 定位实际生效值,讲清两层 manifest 的分工、加载顺序与覆盖优先级,并给出多环境配置与团队共享配置的组织方式。
发布 DSH 插件 + 防御性编程 + 事故复盘:把插件做成可信赖的资产
部署与运维
高级
插件的三种分发方式与版本约定、发布前必须过的检查项;结果报告、dispose 停稳、凭据擦除、链接删除、回调隔离五个防御性模式;以及 dsh 仓库那条「每个 bug 都写复盘」的工程纪律,怎么用在你自己的插件与团队里。
Deepseek harness 安装配置保姆教程
部署与运维
入门
从零把 dsh 跑起来:npx 与全局安装、Web UI 首次配置、工作目录与四种运行模式,再到 DeepSeek / 智谱 GLM / 阿里千问 / 小米 / 火山方舟五家模型提供方的配置步骤,附第三方桌面客户端与新手常见坑。
AI 应用可观测性:日志、监控与告警实战
部署与运维
进阶
生产环境的 AI 应用需要完善的可观测性体系。本文详解 Token 用量监控、API 延迟追踪、错误率告警、成本分析仪表板和日志最佳实践,帮助你构建可靠的 AI 服务。
大模型推理性能优化:vLLM 与 Continuous Batching
部署与运维
高级
模型上线后吞吐与延迟是核心指标。本文深入剖析 vLLM 的 PagedAttention、Continuous Batching 原理,并给出从基准测试、参数调优到生产部署的完整优化路线。
DeepSeek 模型本地部署完全指南
部署与运维
进阶
云端API虽好,但很多场景需要本地部署——数据安全、低延迟、离线使用。本文全面讲解DeepSeek模型的本地部署方案,涵盖Ollama、vLLM、llama.cpp等主流工具,从硬件选型到性能调优全覆盖。
AI 应用的监控与可观测性
部署与运维
高级
AI应用的可观测性远比传统应用复杂——需要监控LLM调用延迟、Token消耗、幻觉率、用户满意度等多维指标。本文构建一个完整的AI应用监控体系,涵盖指标采集、告警配置、成本追踪和质量监控。
AI API 成本优化实战
部署与运维
进阶
AI API的token费用看似便宜,但规模化后成本可能失控。本文从提示词压缩、语义缓存、模型路由、批处理等维度出发,系统讲解AI API成本优化的实战策略,帮你的月度账单降低50%-80%。
AI 服务容器化最佳实践
部署与运维
进阶
将AI模型服务容器化是生产部署的第一步。本文讲解Docker镜像优化、GPU支持、健康检查和Kubernetes部署的完整方案。
CI/CD 流水线中的 AI 测试
部署与运维
进阶
将AI模型测试集成到CI/CD流水线是持续交付高质量AI服务的关键。本文讲解自动评估、回归测试、性能基准和部署门禁的完整方案。
GPU 集群管理与调度
部署与运维
高级
管理数十张GPU的集群需要专业的调度策略。本文讲解GPU资源管理、任务优先级调度、显存碎片整理和多租户隔离的实践经验。
GPU 加速推理优化深度指南
部署与运维
高级
GPU 推理优化是降低大模型部署成本的关键。本文深入讲解 FlashAttention、量化推理、TensorRT 加速、连续批处理等核心技术,帮助你最大化 GPU 利用率。
大模型推理加速技术全景
部署与运维
进阶
推理速度直接决定用户体验。本文系统讲解 KV Cache、Speculative Decoding、模型量化、算子融合等推理加速技术,帮助你从原理到实践全面掌握大模型推理优化。
大模型API服务化最佳实践
部署与运维
高级
将大模型能力API化是企业级应用的关键环节。本文从架构设计、限流策略、缓存优化、安全防护等维度,系统讲解大模型API服务化的最佳实践。
vLLM高性能推理部署
部署与运维
进阶
vLLM是当前最先进的开源大模型推理引擎。本文深入讲解vLLM的PagedAttention原理、生产环境配置、性能调优策略和监控方案,帮助你构建高吞吐量的推理服务。
大模型本地部署方案对比
部署与运维
入门
本地部署大模型是保障数据安全和控制成本的关键方案。本文对比Ollama、vLLM、llama.cpp等主流部署方案,从易用性、性能、硬件需求等维度帮助你做出选择。