最新博客文章
9 / 173AI 开发实战教程,从零到一构建你的 AI 应用。
全部173
入门32
进阶86
高级55
全部
提示词工程12
RAG检索增强16
Agent开发31
模型微调18
部署与运维22
AI应用开发33
DeepSeek API16
多模态开发3
AI 安全3
模型推理1
检索系统1
RAG检索1
模型架构1
API 开发1
Agent 开发10
模型部署1
多模态1
模型评测2
教程
日期
DeepSeek 推理加速深度教程
部署与运维
高级
全面掌握 DeepSeek 模型推理加速技术。vLLM、SGLang、TensorRT-LLM、llama.cpp 四大引擎深度对比,从部署到调优,从单卡到分布式,完整的推理加速方案。
DeepSeek 性能调优教程
部署与运维
高级
DeepSeek 性能调优完整指南:GPU 显存优化、批处理策略、量化技术、并发控制、延迟优化。含 profiling 工具使用、性能基准测试和最佳实践,实现吞吐量和延迟的最优平衡。
插件配置与 Bundle / Profile 分层:dsh 的生效配置到底从哪来
部署与运维
高级
dsh 的配置是分层叠加的:插件 schema 默认值、Profile、Bundle、用户覆盖与命令行 patch。本文用 dsh --dump-config 定位实际生效值,讲清两层 manifest 的分工、加载顺序与覆盖优先级,并给出多环境配置与团队共享配置的组织方式。
发布 DSH 插件 + 防御性编程 + 事故复盘:把插件做成可信赖的资产
部署与运维
高级
插件的三种分发方式与版本约定、发布前必须过的检查项;结果报告、dispose 停稳、凭据擦除、链接删除、回调隔离五个防御性模式;以及 dsh 仓库那条「每个 bug 都写复盘」的工程纪律,怎么用在你自己的插件与团队里。
大模型推理性能优化:vLLM 与 Continuous Batching
部署与运维
高级
模型上线后吞吐与延迟是核心指标。本文深入剖析 vLLM 的 PagedAttention、Continuous Batching 原理,并给出从基准测试、参数调优到生产部署的完整优化路线。
AI 应用的监控与可观测性
部署与运维
高级
AI应用的可观测性远比传统应用复杂——需要监控LLM调用延迟、Token消耗、幻觉率、用户满意度等多维指标。本文构建一个完整的AI应用监控体系,涵盖指标采集、告警配置、成本追踪和质量监控。
GPU 集群管理与调度
部署与运维
高级
管理数十张GPU的集群需要专业的调度策略。本文讲解GPU资源管理、任务优先级调度、显存碎片整理和多租户隔离的实践经验。
GPU 加速推理优化深度指南
部署与运维
高级
GPU 推理优化是降低大模型部署成本的关键。本文深入讲解 FlashAttention、量化推理、TensorRT 加速、连续批处理等核心技术,帮助你最大化 GPU 利用率。
大模型API服务化最佳实践
部署与运维
高级
将大模型能力API化是企业级应用的关键环节。本文从架构设计、限流策略、缓存优化、安全防护等维度,系统讲解大模型API服务化的最佳实践。