登录
下载
Skill UI
浏览并发现
15558+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
GPU
,共找到
116
条记录
默认排序
最新上传
最多下载
Ollama本地LLM部署配置
ollama-setup
jeremylongshore/claude-code-plugins-plus-skills
122
本技能用于配置和部署本地的大型语言模型(LLM)环境,使用 Ollama。它会自动检测您的操作系统和硬件资源,选择合适的模型,并完成在 macOS、Linux 或 Docker 上的安装。这使得用户能够实现离线、免费的AI推理,无需依赖外部API服务,适用于构建生产环境的AI应用。
查看详情
OpenRLHF训练套件
openrlhf-training
Orchestra-Research/AI-Research-SKILLs
474
一个基于Ray和vLLM的高性能RLHF训练框架,兼容PPO、GRPO、RLOO、DPO,借助ZeRO-3与分布式架构在多GPU集群上加速7B-70B+大模型的策略与奖励优化流程。
查看详情
闪电注意力优化器
optimizing-attention-flash
Orchestra-Research/AI-Research-SKILLs
55
Flash Attention 优化器在训练或运行长序列 Transformer 时提供 2-4 倍加速和 10-20 倍内存削减,适用于缓解注意力显存瓶颈与推理延迟,支持 PyTorch 原生 SDPA、flash-attn 库、H100 FP8 及滑动窗口注意力等场景。
查看详情
PEFT 高效微调指南
peft-fine-tuning
Orchestra-Research/AI-Research-SKILLs
71
介绍 HuggingFace PEFT 中 LoRA/QLoRA 微调流程,帮助在有限 GPU 上只训练小于 1% 参数并高效管理多适配器部署。
查看详情
Ray数据处理平台
ray-data
Orchestra-Research/AI-Research-SKILLs
76
Ray Data 提供可扩展的分布式数据处理,支持 CPU/GPU 流式执行,兼容 Parquet、CSV、JSON、图像等多模态,集成 PyTorch、TensorFlow、Ray Train,适合批量推理、ETL 与大规模预处理。
查看详情
Ray Train 分布式协调
ray-train
Orchestra-Research/AI-Research-SKILLs
64
Ray Train 统一协调 PyTorch、TensorFlow 与 HuggingFace 的分布式训练,从单机扩展到多节点集群,自动处理显卡分配、容错、断点恢复与超参搜索,帮助团队在无需大量改动的前提下完成大规模模型训练。
查看详情
高吞吐量大模型服务
serving-llms-vllm
Orchestra-Research/AI-Research-SKILLs
423
使用 vLLM 的分块注意力、连续批处理、量化与张量并行能力,为 OpenAI 兼容接口提供高吞吐量的生产级大模型服务,兼顾延迟、GPU 利用和扩展性。
查看详情
SGLang 结构化推理服务
sglang
Orchestra-Research/AI-Research-SKILLs
150
SGLang 是面向 LLM/VLM 的高性能服务框架,采用 RadixAttention 前缀缓存实现 JSON/正则/语法结构化输出、函数调用型代理流程,并在多 GPU 生产环境中比 vLLM 快 5 倍。
查看详情
GLSL着色器编程指南
shader-programming-glsl
sickn33/antigravity-awesome-skills
106
本指南是高效GLSL着色器(顶点/片段)的专家教程,适用于WebGL和游戏引擎。内容涵盖着色器结构、Uniforms、varying变量等基础知识,并深入讲解了射线行进、图像后处理等高级图形渲染技术,帮助用户优化GPU性能,实现自定义视觉效果。
查看详情
SkyPilot 多云作业编排
skypilot-multi-cloud-orchestration
Orchestra-Research/AI-Research-SKILLs
376
SkyPilot 提供面向机器学习的多云编排,自动选取最优云/区域、恢复抢占型实例、管理多节点训练与模型服务,帮助团队降低 GPU 费用并规避供应商锁定。
查看详情
TensorRT LLM 推理优化
tensorrt-llm
Orchestra-Research/AI-Research-SKILLs
334
在 NVIDIA GPU 上使用 TensorRT 优化大模型推理,支持 FP8/INT4 量化、多 GPU 扩展及高吞吐量部署,适合实时与生产环境。
查看详情
PyTorch原生智能体RL训练框架
torchforge-rl-training
Orchestra-Research/AI-Research-SKILLs
135
torchforge是Meta推出的用于智能体强化学习(RL)的PyTorch原生框架。它将核心的RL算法与复杂的分布式基础设施进行了彻底分离。用户可以专注于算法的快速实验和开发,无需担心底层分布式训练、权重同步等复杂问题,支持从单卡到大规模集群的扩展训练。
查看详情
上一页
1
2
3
4
5
...
8
9
10
下一页
语言
简体中文
English