登录
软件下载
帮助文档
新闻资讯
Skill UI
浏览并发现
18959+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
GRPO
,共找到
11
条记录
默认排序
最新上传
最多下载
TRL RLHF 训练管线
fine-tuning-with-trl
Orchestra-Research/AI-Research-SKILLs
467
使用 TRL 提供的 SFT、DPO、PPO/GRPO 和奖励模型训练流程,对 HuggingFace 模型进行 RLHF 调整,使其符合偏好与人类反馈。
查看详情
GRPO强化学习微调
grpo-rl-training
Orchestra-Research/AI-Research-SKILLs
452
提供基于TRL的GRPO/RLHF训练实战经验,包含数据集预处理、奖励函数设计与结构化输出指导,适合需多目标对齐且缺乏偏好对的数据场景。
查看详情
OpenRLHF训练套件
openrlhf-training
Orchestra-Research/AI-Research-SKILLs
307
一个基于Ray和vLLM的高性能RLHF训练框架,兼容PPO、GRPO、RLOO、DPO,借助ZeRO-3与分布式架构在多GPU集群上加速7B-70B+大模型的策略与奖励优化流程。
查看详情
SLIME 强化训练框架
slime-rl-training
Orchestra-Research/AI-Research-SKILLs
380
为 GLM 系列大模型提供基于 Megatron-LM 与 SGLang 的后训练强化学习指导,包含 GRPO rollout、灵活数据缓冲与异步/多轮训练流程,适用于研究及产研部署。
查看详情
PyTorch原生智能体RL训练框架
torchforge-rl-training
Orchestra-Research/AI-Research-SKILLs
138
torchforge是Meta推出的用于智能体强化学习(RL)的PyTorch原生框架。它将核心的RL算法与复杂的分布式基础设施进行了彻底分离。用户可以专注于算法的快速实验和开发,无需担心底层分布式训练、权重同步等复杂问题,支持从单卡到大规模集群的扩展训练。
查看详情
火山引擎LLM强化训练
verl-rl-training
Orchestra-Research/AI-Research-SKILLs
462
使用火山引擎 verl 训练 LLM 的强化学习指南,涵盖 GRPO、PPO、价值网络、分布式 rollout、数据配置与生产部署等流程。
查看详情
Hugging Face云端大型语言模型训练
hugging-face-model-trainer
sickn33/antigravity-awesome-skills
481
本技能指导用户利用Hugging Face的云基础设施,进行大型语言模型和视觉模型的专业微调与训练。支持使用TRL(SFT, DPO等)或Unsloth等前沿方法,无需本地GPU环境即可在云端完成复杂的训练任务,并支持将模型转换为GGUF格式进行本地部署。
查看详情
使用TRL训练和微调大型语言模型
trl-training
sickn33/antigravity-awesome-skills
316
使用此技能,您可以使用TRL库对基础大型语言模型进行高级训练和微调。它支持包括SFT、DPO、GRPO等在内的多种前沿模型对齐和优化技术。适用于需要根据特定任务需求,利用偏好数据和奖励模型定制化模型的场景。
查看详情
Hugging Face 模型微调训练
hugging-face-model-trainer
sickn33/agentic-awesome-skills
473
使用 Hugging Face Jobs 基础设施训练或微调语言及视觉模型。支持 SFT、DPO、GRPO 等训练方法,并提供 GGUF 转换以支持本地部署。需 Pro 账户及 HF_TOKEN 保存至 Hub,适用于云端 GPU 训练,无需本地环境。
查看详情
TRL 模型微调训练
trl-training
sickn33/agentic-awesome-skills
149
使用 Hugging Face TRL 库通过命令行训练与微调 Transformer 语言模型,支持 SFT、DPO、GRPO、RLOO、KTO 及奖励模型训练,并可用 LoRA、YAML 配置和 Accelerate 多卡分布式训练。
查看详情
Unsloth微调
unsloth-finetuning
sickn33/agentic-awesome-skills
415
使用Unsloth Core在单张消费级GPU上微调大语言模型,涵盖显存规划、LoRA/QLoRA、GRPO/DPO后训练、聊天模板正确性及GGUF导出。
查看详情
1
语言
简体中文
English