登录
软件下载
帮助文档
新闻资讯
Skill UI
浏览并发现
16597+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
大模型可靠性
,共找到
18
条记录
默认排序
最新上传
最多下载
大语言模型智能体评估
agent-evaluation
sickn33/antigravity-awesome-skills
271
这是一个用于全面测试和评估大型语言模型(LLM)智能体的框架。它超越了简单的通过/失败判断,深入评估智能体的复杂行为、可靠性指标和能力一致性。适用于生产环境的监控,帮助识别高级AI智能体中的微妙故障模式。
查看详情
LangChain CI/CD集成与测试框架
langchain-ci-integration
jeremylongshore/claude-code-plugins-plus-skills
209
这是一个为LangChain应用设计的完整CI/CD流水线。它通过GitHub Actions自动化质量保障,集成了快速的模拟单元测试和使用真实大型语言模型(LLM)的集成测试。核心功能包括端到端的RAG流程验证和LangSmith追踪,确保应用的高可靠性。
查看详情
LLM模型评估与性能测试
llm-evaluation
sickn33/antigravity-awesome-skills
357
提供了一套全面的大型语言模型(LLM)评估框架。内容涵盖自动化指标(如BLEU、ROUGE、BERTScore)、人工评估维度以及使用LLM作为裁判的先进方法。适用于系统性地衡量模型性能、对比不同Prompt或模型,确保AI应用的可靠性和可部署性。
查看详情
构建AI模型故障转移与高可用性
openrouter-fallback-config
jeremylongshore/claude-code-plugins-plus-skills
434
本技能详细介绍了如何在OpenRouter环境下为大型语言模型(LLM)配置故障转移和回退机制。它涵盖了原生模型回退、提供商路由策略和客户端级故障链设计。当构建对可靠性要求极高、必须在主模型或提供商不可用时也能持续运作的系统时,应使用此模式,以确保API集成和系统优雅降级。
查看详情
AI模型可用性与健康检查
openrouter-model-availability
jeremylongshore/claude-code-plugins-plus-skills
413
本技能用于监控通过OpenRouter接入的各类大模型(如GPT-4o, Claude)的实时状态和健康状况。它提供主动健康探测、模型目录查询和定时监控脚本,确保系统在关键模型出现故障、性能下降或不可用时,能及时发现问题并触发故障转移机制,适用于构建高可靠性的AI应用。
查看详情
API容错与可靠性模式实现
perplexity-reliability-patterns
jeremylongshore/claude-code-plugins-plus-skills
89
本指南旨在解决在生产环境中集成外部大型语言模型(LLM)API(如Perplexity Sonar)时遇到的可靠性挑战。它提供了完整的容错模式,包括电路断路器、模型级回退、流式超时检测和缓存机制,确保您的应用程序即使在外部服务出现暂时故障或性能波动时,也能保持稳定和高可用性。
查看详情
Vast.ai CI/CD GPU自动化测试
vastai-ci-integration
jeremylongshore/claude-code-plugins-plus-skills
302
本技能指导如何将Vast.ai的GPU资源配置集成到CI/CD流程中(如GitHub Actions)。它能实现自动化、成本可控的GPU测试、模型验证和性能基准测试。通过脚本管理实例的生命周期,确保测试环境稳定且资源使用后能自动清理,大大提高了DevOps流程的可靠性和效率。
查看详情
LLM提示词结构化优化
ai-md
sickn33/antigravity-awesome-skills
202
本方法论将冗长、自然的语言系统指令,转化为原子化、结构化的标签格式。它通过分解复杂的规则为明确的标签(如trigger:、action:),解决了大型语言模型(LLM)指令遵循度低的问题,极大地提高了规则执行的精准度、可靠性和效率。
查看详情
PydanticAI:类型安全LLM代理框架
pydantic-ai
sickn33/antigravity-awesome-skills
226
PydanticAI 是一个强大的 Python 框架,它将 Pydantic 的类型验证能力引入大型语言模型(LLMs)。它允许开发者构建生产级的 AI 代理,确保 LLM 的输出具有严格的结构化和数据类型安全,不再仅仅是原始文本。框架支持工具调用、依赖注入和多模型兼容性,适用于需要高可靠性和准确数据结构的复杂 AI 场景。
查看详情
云端大模型回归测试
cloud-provider-regression-test
SharpAI/DeepCamera
337
本工具用于自动化执行所有已启用云端大语言模型(LLM)提供商的回归测试。它全面验证了连接性、标准聊天补全、结构化JSON输出以及SSE流式传输能力。适用于确保多云AI集成在持续集成/持续部署流程中的稳定性和可靠性。
查看详情
GateGuard:预执行逻辑门控
gateguard
affaan-m/everything-claude-code
80
这是一个强大的预执行钩子,用于在AI代理修改代码、创建文件或执行危险命令前强制进行严格的验证。它不依赖于AI的自我评估,而是强制模型收集事实(如依赖模块、数据结构等),极大地提高了代码的可靠性和设计深度。适用于复杂的代码库和高风险的开发流程。
查看详情
AI安全扫描与漏洞检测
aig-scanner
Tencent/AI-Infra-Guard
177
本工具依托红心实验室的AI-Infra-Guard框架,提供全方位的AI安全扫描服务。可对AI基础设施、工具、技能、Agent以及大型语言模型进行深度安全审计和漏洞检测,包括越狱测试,确保AI系统的安全性和可靠性。
查看详情
1
2
下一页
语言
简体中文
English