登录
下载
Skill UI
浏览并发现
15558+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
GPU
,共找到
116
条记录
默认排序
最新上传
最多下载
CoreWeave GPU部署CI/CD集成
coreweave-ci-integration
jeremylongshore/claude-code-plugins-plus-skills
358
用于自动化CoreWeave GPU云工作负载的完整部署生命周期。该流程集成了单元测试、容器镜像构建(推送到GHCR)和到CoreWeave Kubernetes集群的滚动部署。适用于需要稳定、高性能部署的GPU依赖型机器学习推理模型。核心功能包括验证GPU资源请求和使用标准的Kubernetes API进行部署管理。
查看详情
CoreWeave GPU集群故障排查
coreweave-common-errors
jeremylongshore/claude-code-plugins-plus-skills
123
本指南旨在为用户提供一套完整的CoreWeave基础设施故障排除流程。它专门用于诊断和修复在使用Kubernetes部署AI/ML工作负载时遇到的核心问题,包括GPU资源调度、Pod状态异常、CUDA内存不足以及网络通信超时等。
查看详情
CoreWeave本地开发部署流程
coreweave-local-dev-loop
jeremylongshore/claude-code-plugins-plus-skills
455
本指南旨在为CoreWeave GPU部署提供完整的本地开发工作流。它涵盖了从本地构建Docker容器、使用kubectl进行YAML清单的预验证(dry-run),到最终部署AI推理服务所需的完整流程和最佳实践。
查看详情
CoreWeave GPU迁移与升级
coreweave-upgrade-migration
jeremylongshore/claude-code-plugins-plus-skills
157
该工具用于管理和自动化CoreWeave云基础设施的升级与迁移过程。它支持执行GPU型号升级(如A100到H100)、CUDA版本兼容性检查,并利用Kubernetes API审计部署、检测过时实例,确保集群平稳过渡。
查看详情
批量机器学习实验队列管理
experiment-queue
wanshuiyin/Auto-claude-code-research-in-sleep
381
该技能专为管理远程GPU集群上的大规模、复杂机器学习实验而设计。它能处理多随机种子扫描、多阶段波次过渡和复杂的深度学习流水线。核心功能包括OOM感知重试、清理僵尸会话和确定性调度,能够有效防止资源竞争,适用于复杂的批处理和分阶段训练场景。
查看详情
CAST AI自动扩缩容配置
castai-core-workflow-a
jeremylongshore/claude-code-plugins-plus-skills
492
本工作流指导用户配置CAST AI的自动扩缩容策略,实现Kubernetes集群的最佳成本管理和资源利用。内容涵盖启用竞价实例(Spot Instances)、设置节点下沉/驱逐规则、定义集群限制,并通过Terraform创建特定工作负载的节点模板,确保资源分配的稳定性和成本效益。
查看详情
CoreWeave KServe GPU推理服务部署
coreweave-core-workflow-a
jeremylongshore/claude-code-plugins-plus-skills
155
本指南详细介绍了如何在CoreWeave上使用KServe部署生产级机器学习推理服务。内容涵盖了配置GPU调度、实现自动扩缩容以及设置冷启动优化的流程。适用于需要部署大型语言模型(LLMs)或其他复杂AI模型的MLOps工程师。
查看详情
CoreWeave分布式GPU训练工作流
coreweave-core-workflow-b
jeremylongshore/claude-code-plugins-plus-skills
142
本指南详细介绍了如何在CoreWeave平台上运行大规模的分布式GPU训练任务。它涵盖了单节点多GPU配置和多节点训练,支持PyTorch DDP,是进行大型语言模型(LLM)微调或需要高性能计算集群的深度学习模型训练的推荐工作流。
查看详情
CoreWeave GPU成本优化指南
coreweave-cost-tuning
jeremylongshore/claude-code-plugins-plus-skills
258
本指南提供了一套全面的策略,用于优化CoreWeave上的云GPU资源支出。它涵盖了从根据模型需求进行精细化资源配置(Right-sizing),到为开发环境实施从零扩展(Scale-to-Zero),以及利用量化技术(如AWQ)等多个维度,帮助用户在确保高性能的同时,实现AI/ML工作负载的最大化成本节约。
查看详情
核心AI数据管理与合规
coreweave-data-handling
jeremylongshore/claude-code-plugins-plus-skills
148
用于在GPU云工作负载中管理大型数据集、模型权重和训练数据。它涵盖了数据生命周期管理的全流程,包括通过Kubernetes PVC安全导入、合规导出和数据验证。确保数据处理过程符合行业最佳实践、加密标准(AES-256)和数据安全合规要求。
查看详情
CoreWeave诊断信息收集包
coreweave-debug-bundle
jeremylongshore/claude-code-plugins-plus-skills
271
本工具用于收集CoreWeave集群的全面诊断信息,包括GPU节点状态、Kubernetes Pod日志、集群事件和资源分配情况。它将所有关键的系统诊断数据打包成一个归档文件,极大地简化了提交技术支持工单的流程,便于快速定位容器化环境下的故障根源。
查看详情
CoreWeave GPU推理服务部署
coreweave-deploy-integration
jeremylongshore/claude-code-plugins-plus-skills
146
本技能旨在指导用户在CoreWeave Kubernetes集群上部署和管理GPU加速的AI推理服务。内容涵盖了从Docker容器化、配置GPU资源限制(如A100/H100),到设置健康检查和执行滚动更新的全流程最佳实践,适用于大规模多模型推理和云端AI工作负载管理。
查看详情
上一页
1
2
3
4
5
6
7
8
9
10
下一页
语言
简体中文
English