登录
软件下载
帮助文档
新闻资讯
Skill UI
浏览并发现
18950+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
回归
,共找到
12
条记录
默认排序
最新上传
最多下载
Claude 评估驱动框架
eval-harness
affaan-m/everything-claude-code
90
Claude Code正式评估框架,先定义能力与回归标准,再用代码/模型/人工评估多个阶段,并持续跟踪pass@k和pass^k等可靠性指标以确保交付质量。
查看详情
Langfuse CI/CD:LLM质量测试集成
langfuse-ci-integration
jeremylongshore/claude-code-plugins-plus-skills
444
本指南展示如何将Langfuse集成到CI/CD流水线(例如GitHub Actions)中,用于自动化大型语言模型(LLM)的质量测试。用户可以实现提示词回归测试、调用链验证和实验驱动的质量门禁,确保AI应用的稳定性和性能。
查看详情
Mistral AI CI/CD 提示词测试
mistral-ci-integration
jeremylongshore/claude-code-plugins-plus-skills
486
本工具用于在CI/CD流程中自动化Mistral AI的验证和测试。它支持提示词回归测试、模型响应质量检查和API成本估算,确保每次代码提交和合并请求都能保证AI功能的稳定性和可靠性,是构建高质量AI应用的必备环节。
查看详情
凤凰AI可观测平台
phoenix-observability
Orchestra-Research/AI-Research-SKILLs
440
Phoenix 是开源AI可观测平台,可用于追踪、评估和监控大语言模型应用,支持实验对比、数据集回归测试与实时生产监控,帮助工程团队自托管排查与优化。
查看详情
Scikit-learn 机器学习
scikit-learn
K-Dense-AI/scientific-agent-skills
485
提供使用 scikit-learn 进行机器学习的全面指南,涵盖分类、回归、聚类、预处理、模型评估和流水线构建,适用于构建生产级机器学习工作流。
查看详情
云端大模型回归测试
cloud-provider-regression-test
SharpAI/DeepCamera
337
本工具用于自动化执行所有已启用云端大语言模型(LLM)提供商的回归测试。它全面验证了连接性、标准聊天补全、结构化JSON输出以及SSE流式传输能力。适用于确保多云AI集成在持续集成/持续部署流程中的稳定性和可靠性。
查看详情
大模型链评估与回归测试
langchain-eval-harness
jeremylongshore/claude-code-plugins-plus-skills
387
本工具提供了一套全面的、可复现的LLM链和智能体评估系统。它集成了黄金数据集管理、LangSmith评估、RAGAS指标、deepeval LLM判别等功能。适用于为新构建的链条设置质量基线、诊断模型切换后的性能退化,以及在CI/CD流程中设置回归检测门禁。
查看详情
Scikit-learn Python机器学习库
scikit-learn
sickn33/antigravity-awesome-skills
468
Scikit-learn是Python领域标准的机器学习库。它提供全面的工具集,用于执行监督学习(如分类、回归)和无监督学习(如聚类、降维)。用户可以使用它来构建完整的机器学习流程,进行数据预处理、模型评估和优化,适用于构建端到端的各种数据科学和预测系统。
查看详情
AI代理评估套件
agent-evals
sickn33/agentic-awesome-skills
180
为 AI 代理构建自动化评估套件,涵盖黄金数据集、评分标准与回归门禁;包含提示级单元测试、工具调用决策校验、端到端任务测试、安全对抗测试以及 LLM 裁判打分,让代理能力在持续迭代中安全提升。
查看详情
智能体行为评估
agent-evaluation
sickn33/agentic-awesome-skills
492
使用版本化用例和显式验证器评估智能体行为。此技能有助于比较智能体或提示词变更,复现故障并运行回归测试。确保在声明任务分布上的可靠性,避免从通用分数推断产品就绪状态。包含不确定性报告和安全性验证方法。
查看详情
智能体评估报告生成
agent-evaluation-reporting
sickn33/agentic-awesome-skills
179
将 AI 智能体评估运行转化为决策就绪报告,确保自主、辅助、失败及超时结果清晰可比。该方法定义正确的分母计算指标,诚实处理延迟和成本数据,并将证据映射到决策门限。适用于智能体基准测试、回归测试及生产就绪验证。
查看详情
RAG 系统可观测性评估
rag-observability-evals
sickn33/agentic-awesome-skills
144
本技能用于监控和评估检索增强生成(RAG)系统的性能。通过检索质量指标、幻觉检测和事实性检查,确保 AI 生成内容可靠。支持使用 RAGAS 等库进行回归测试和生产环境可观测性分析。
查看详情
1
语言
简体中文
English