登录
软件下载
帮助文档
新闻资讯
Skill UI
浏览并发现
16644+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
学术评估
,共找到
30
条记录
默认排序
最新上传
最多下载
LLM 评估框架
evaluating-llms-harness
Orchestra-Research/AI-Research-SKILLs
66
提供涵盖 MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag 等 60+ 学术基准测试的标准化评估流程,可用来对 HuggingFace、vLLM 或 API 模型打分、比对性能、跟踪训练进度。
查看详情
自动研究论文多轮审阅
auto-review-loop-minimax
wanshuiyin/Auto-claude-code-research-in-sleep
120
本技能实现了一个自主、多轮次的科研论文审阅循环,模拟顶级学术会议的同行评审过程。它能够迭代地对研究文档进行审查、发现不足、提出修改意见,并进行再审查,直到达到“准备就绪”的评估标准或达到最大轮次限制。适用于学术写作、论文完善或深度项目文档撰写。
查看详情
研究想法生成与评估
idea-creator
wanshuiyin/Auto-claude-code-research-in-sleep
395
该技能根据用户提供的广泛研究方向,生成并排序可发表的研究想法。通过试点实验和模型审查系统性地验证概念,优化 GPU 效率和新颖性。适用于头脑风暴、学术探索及识别可行的研究路径。
查看详情
学术论文审稿助手
academic-paper-review
bytedance/deer-flow
331
针对论文审稿、研究评估或总结类请求,提供结构化的学术评审分析,涵盖摘要、方法、贡献、文献定位与改进建议,适用于各个研究领域的上传 PDF 或链接资料。
查看详情
多视角学术论文评审助手
academic-paper-reviewer
Imbad0202/academic-research-skills
169
该技能模拟完整的国际期刊同行评审流程,动态配置五座评审席(期刊适配评审员、三位同行评审员及魔鬼代言人)。自动识别论文领域与方法,生成五份独立评审报告及编辑决策信与修订路线图。支持全文评审、复核、快速评估及评审校准等多种模式,支持多语言输入。
查看详情
运行DeepSWE编程代理基准测试
run-deep-swe
sickn33/antigravity-awesome-skills
335
用于对大型语言模型(LLM)进行全面的编码代理能力评估。它通过DeepSWE基准测试,使用OpenRouter和mini-swe-agent,对113个任务进行评测,生成可复现的性能得分和评估报告。适用于模型能力对比、开发评估和学术研究。
查看详情
AAMAS成果物评估指南
aamas-artifact-evaluation
brycewang-stanford/Awesome-Journal-Skills
232
本指南为学术论文(尤其针对AAMAS)提供了一套完善的成果物打包流程,用于支持多智能体系统(MARL)和博弈论的复杂证据。它强调成果物必须高度可检查和可复现,内容涵盖游戏定义、环境代码、对手设置和交互协议,而不能仅是模型本身,以保证学术评审的严谨性。
查看详情
AAMAS会议审稿流程指南
aamas-review-process
brycewang-stanford/Awesome-Journal-Skills
342
本指南详细介绍了AAMAS顶级学术会议的同行评审流程。它涵盖了从初次投稿、技术评估(如正确性、意义和严谨性)、作者反驳到程序主席最终决策的完整学术过程。适用于准备投稿或需要理解多智能体系统研究成果发表标准的学者。
查看详情
智能用户界面会议投稿指南
acm-conference-on-intelligent-user-interfaces
brycewang-stanford/Awesome-Journal-Skills
143
本指南是为目标投递ACM智能用户界面会议(IUI)的作者准备的。它帮助评估论文的适用性,指导如何完善范围,理解证据要求,并为与AI增强交互、自适应系统或用户建模相关的论文进行学术定位。
查看详情
ACM多媒体会议投稿定位指南
acm-international-conference-on-multimedia
brycewang-stanford/Awesome-Journal-Skills
199
本技能旨在指导作者评估其计算机科学手稿是否适合投稿至ACM多媒体国际会议(ACM MM)。它提供了一套完整的策略,帮助作者在多模态、检索和媒体应用领域,精准地“定位”和“包装”论文的贡献,以满足顶级学术会议的审稿要求和发表范式。
查看详情
AISTATS学术会议投稿策略指南
artificial-intelligence-and-statistics
brycewang-stanford/Awesome-Journal-Skills
478
本指南为作者准备投稿AISTATS会议论文提供专业指导。它帮助作者评估论文的贡献是否具有统计学基础,如何重构文章的叙事,并指导作者增强理论深度和实验证据,以适应顶级AI统计会议的审稿要求。
查看详情
大语言模型评估严谨指南
colm-experiments
brycewang-stanford/Awesome-Journal-Skills
496
本指南提供了设计和审计大语言模型(LLM)实证评估的最佳实践。它涵盖了数据污染、基线公平性、模型版本漂移和解码参数敏感性等关键陷阱,指导用户构建一套严谨、可复现、科学可靠的LLM评估体系,适用于学术研究和模型评测。
查看详情
1
2
3
下一页
语言
简体中文
English