Skills Plugins MCP Prompt Model 博客 我的中心

最新博客文章

9 / 173

AI 开发实战教程,从零到一构建你的 AI 应用。

教程 日期
DeepSeek 推理加速深度教程 部署与运维 高级 全面掌握 DeepSeek 模型推理加速技术。vLLM、SGLang、TensorRT-LLM、llama.cpp 四大引擎深度对比,从部署到调优,从单卡到分布式,完整的推理加速方案。 2025-06 ·25 分钟阅读 DeepSeek 性能调优教程 部署与运维 高级 DeepSeek 性能调优完整指南:GPU 显存优化、批处理策略、量化技术、并发控制、延迟优化。含 profiling 工具使用、性能基准测试和最佳实践,实现吞吐量和延迟的最优平衡。 2025-06 ·25 分钟阅读 插件配置与 Bundle / Profile 分层:dsh 的生效配置到底从哪来 部署与运维 高级 dsh 的配置是分层叠加的:插件 schema 默认值、Profile、Bundle、用户覆盖与命令行 patch。本文用 dsh --dump-config 定位实际生效值,讲清两层 manifest 的分工、加载顺序与覆盖优先级,并给出多环境配置与团队共享配置的组织方式。 2026-09 ·52 分钟阅读 发布 DSH 插件 + 防御性编程 + 事故复盘:把插件做成可信赖的资产 部署与运维 高级 插件的三种分发方式与版本约定、发布前必须过的检查项;结果报告、dispose 停稳、凭据擦除、链接删除、回调隔离五个防御性模式;以及 dsh 仓库那条「每个 bug 都写复盘」的工程纪律,怎么用在你自己的插件与团队里。 2026-09 ·39 分钟阅读 大模型推理性能优化:vLLM 与 Continuous Batching 部署与运维 高级 模型上线后吞吐与延迟是核心指标。本文深入剖析 vLLM 的 PagedAttention、Continuous Batching 原理,并给出从基准测试、参数调优到生产部署的完整优化路线。 2026-08 ·23 分钟阅读 AI 应用的监控与可观测性 部署与运维 高级 AI应用的可观测性远比传统应用复杂——需要监控LLM调用延迟、Token消耗、幻觉率、用户满意度等多维指标。本文构建一个完整的AI应用监控体系,涵盖指标采集、告警配置、成本追踪和质量监控。 2026-07 ·20 分钟阅读 GPU 集群管理与调度 部署与运维 高级 管理数十张GPU的集群需要专业的调度策略。本文讲解GPU资源管理、任务优先级调度、显存碎片整理和多租户隔离的实践经验。 2026-07 ·23 分钟阅读 GPU 加速推理优化深度指南 部署与运维 高级 GPU 推理优化是降低大模型部署成本的关键。本文深入讲解 FlashAttention、量化推理、TensorRT 加速、连续批处理等核心技术,帮助你最大化 GPU 利用率。 2025-07 ·19 分钟阅读 大模型API服务化最佳实践 部署与运维 高级 将大模型能力API化是企业级应用的关键环节。本文从架构设计、限流策略、缓存优化、安全防护等维度,系统讲解大模型API服务化的最佳实践。 2025-06 ·20 分钟阅读

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。