登录
下载
Skill UI
浏览并发现
11165+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
A/B测试
,共找到
1370
条记录
默认排序
最新上传
最多下载
LLM成本基准测试
cost-benchmark
ruvnet/ruflo
387
该技能用于运行结构化和对抗性语料库的全面基准测试。它测量了增强器(booster)模型与主流LLM基线(如Gemini、Anthropic)的性能和成本效率。结果以可验证的JSON报告持久化,是发布和审计模型性能声明的关键环节。
查看详情
基准测试性能漂移分析
cost-trend
ruvnet/ruflo
121
该技能用于分析存储的历史基准测试运行数据。它能追踪并报告关键性能指标(如胜率、平均延迟、P99延迟和LLM成本)随时间变化的趋势。这对于发现标准烟雾测试可能遗漏的性能衰退或回归至关重要,确保系统在每次发布或数据集扩展时保持稳定性。
查看详情
C++单元测试与开发流程
cpp-testing
affaan-m/ECC
356
本指南提供了一套基于GoogleTest和CMake/CTest的全面C++测试工作流,适用于现代C++(C++17/20)项目。内容涵盖了TDD循环、使用Mocking和Fixture进行组件隔离、设置CI/CD集成,以及利用内存和线程Sanitizers进行深度调试和代码覆盖率分析。核心用途是确保代码质量和防止功能回归。
查看详情
C# .NET 综合测试模式与实践
csharp-testing
affaan-m/ECC
297
本指南提供了针对C#和.NET应用的全面测试模式。涵盖了使用xUnit、FluentAssertions等最佳实践,包括单元测试、参数化测试、依赖项模拟(Mocking)以及使用Testcontainers进行真实的集成测试。适用于提升代码质量和测试覆盖率的开发场景。
查看详情
骨架化领域聚合根
ddd-aggregate
ruvnet/ruflo
202
该工具用于根据领域驱动设计(DDD)原则,自动为指定的边界上下文骨架化一个完整的聚合根。它会自动生成实体、值对象、仓库接口、领域事件和单元测试桩代码,帮助开发者快速建模新的业务概念,并确保领域不变量得到维护。
查看详情
Django测试驱动开发全指南
django-tdd
affaan-m/ECC
356
本指南全面介绍了使用pytest、factory_boy和Django REST Framework进行测试驱动开发(TDD)的最佳实践。内容涵盖了从项目配置到模型、视图和API测试的完整流程,帮助开发者构建高质量、可维护的Django应用。
查看详情
Django项目部署验证流程
django-verification
affaan-m/ECC
179
这是一个全面的Django项目质量验证流程,特别适用于持续集成/持续部署(CI/CD)环境。它涵盖了代码质量检查、类型安全、数据库迁移、单元测试覆盖率、安全漏洞扫描以及性能分析等多个阶段,旨在确保代码在发布或合并到主分支前达到高质量标准。
查看详情
Playwright端到端测试最佳实践
e2e-testing
affaan-m/ECC
374
本指南详细介绍了使用Playwright构建健壮、可靠且易于维护的端到端(E2E)测试套件。内容涵盖Page Object Model(POM)实践、Playwright高级配置、CI/CD集成、以及处理不稳定(Flaky)测试的策略,旨在确保测试系统的稳定性和可维护性。
查看详情
AI能力评估与回归测试框架
eval-harness
affaan-m/ECC
397
这是一个用于AI辅助代码生成会话的正式评估框架。它遵循开发驱动评估(EDD)原则,使用户能够定义功能能力和回归测试标准。系统支持代码、模型和人工三种评估方式,并通过pass@k等高级指标跟踪可靠性,确保AI智能体的质量和稳定性。
查看详情
F#测试模式与最佳实践
fsharp-testing
affaan-m/ECC
425
本技能包提供了针对F#应用的全面测试模式和最佳实践。它涵盖了单元测试(xUnit, FsUnit)、属性测试(FsCheck)、依赖模拟(NSubstitute)以及完整的集成测试(WebApplicationFactory)。适用于提升代码覆盖率、验证复杂业务逻辑,并构建健壮的.NET测试基础设施。
查看详情
GAIA智能体基准对比与差距分析
gaia-architecture-comparison
ruvnet/ruflo
463
本技能详细对比了GAIA智能体评估框架(如ruflo和HAL),旨在帮助开发者和研究人员识别大型语言模型(LLM)智能体在性能测试中的能力差距。它涵盖了从真实代码执行沙箱到全功能网页浏览等关键技术点,为提升智能体基准测试的准确性和鲁棒性提供路线图。
查看详情
GAIA基准失败调试工具
gaia-debugging
ruvnet/ruflo
94
本技能提供了一个系统化的工作流,用于诊断GAIA基准运行中的模型失败。用户可以分析任务运行痕迹,分类失败模式(如工具缺失、推理错误),找出根本原因,并应用针对性修复,从而系统性地提升AI智能体的性能和测试模型的可靠性。
查看详情
上一页
1
2
3
...
107
108
109
110
111
112
113
114
115
下一页
语言
简体中文
English