登录
软件下载
帮助文档
新闻资讯
Skill UI
浏览并发现
15857+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
TRL
,共找到
5
条记录
默认排序
最新上传
最多下载
TRL RLHF 训练管线
fine-tuning-with-trl
Orchestra-Research/AI-Research-SKILLs
487
使用 TRL 提供的 SFT、DPO、PPO/GRPO 和奖励模型训练流程,对 HuggingFace 模型进行 RLHF 调整,使其符合偏好与人类反馈。
查看详情
GRPO强化学习微调
grpo-rl-training
Orchestra-Research/AI-Research-SKILLs
416
提供基于TRL的GRPO/RLHF训练实战经验,包含数据集预处理、奖励函数设计与结构化输出指导,适合需多目标对齐且缺乏偏好对的数据场景。
查看详情
快速Obsidian插件开发环境
obsidian-local-dev-loop
jeremylongshore/claude-code-plugins-plus-skills
385
本指南提供了一套完整的Obsidian插件快速开发流程。它涵盖了从环境搭建到功能测试的全部步骤,包括使用esbuild进行热重载、通过符号链接挂载插件、利用Chrome DevTools进行调试,以及使用vitest进行单元测试。适用于任何需要高效、快速迭代插件功能的开发者。
查看详情
Hugging Face云端大型语言模型训练
hugging-face-model-trainer
sickn33/antigravity-awesome-skills
108
本技能指导用户利用Hugging Face的云基础设施,进行大型语言模型和视觉模型的专业微调与训练。支持使用TRL(SFT, DPO等)或Unsloth等前沿方法,无需本地GPU环境即可在云端完成复杂的训练任务,并支持将模型转换为GGUF格式进行本地部署。
查看详情
使用TRL训练和微调大型语言模型
trl-training
sickn33/antigravity-awesome-skills
316
使用此技能,您可以使用TRL库对基础大型语言模型进行高级训练和微调。它支持包括SFT、DPO、GRPO等在内的多种前沿模型对齐和优化技术。适用于需要根据特定任务需求,利用偏好数据和奖励模型定制化模型的场景。
查看详情
1
语言
简体中文
English