AI模型评测相关推荐
PubMedQA
PubMedQA是专门用在生物医学研究问题回答的数据集。PubMedQA通过文献摘要回答“是/否/可能”形式的研究问题,
H2O EvalGPT
H2O EvalGPT 是 H2O.ai 用于评估和比较 LLM 大模型的开放工具,它提供了一个平台来了解模型在大量任务
LLMEval3
LLMEval是由复旦大学NLP实验室推出的大模型评测基准,最新的LLMEval-3聚焦于专业知识能力评测,涵盖哲学、经
HELM
HELM是由斯坦福大学推出的大模型评测体系,该评测方法主要包括场景、适配、指标三个模块,每次评测的运行都需要指定一个场景
MMBench
MMBench是多模态基准测试,由上海人工智能实验室、南洋理工大学、香港中文大学、新加坡国立大学和浙江大学的研究人员联合
CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
OpenCompass
OpenCompass是上海人工智能实验室(上海AI实验室)于2023年8月正式推出的大模型开放评测体系,通过完整开源可
AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造
SuperCLUE
SuperCLUE 是针对中文大模型的综合性评测基准,能全面评估模型在多个维度上的性能表现。SuperCLUE 通过多轮
FlagEval
FlagEval(天秤)是北京智源人工智能研究院(BAAI)推出的科学、公正、开放的大模型评测体系及开放平台,为研究人员
C-Eval
C-Eval是一个适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5
Open LLM Leaderboard
Open LLM Leaderboard 是最大的大模型和数据集社区 HuggingFace 推出的开源大模型排行榜单,
AI小编推荐
Ask YouTube
Ask YouTube 是谷歌为YouTube平台推出的一项AI 对话式搜索功能。它将传统的关键词搜索升级为类似智能聊天
Alipay AI Pay
支付宝 AI 付(Alipay AI Pay)是支付宝面向 AI 时代推出的一项专为 AI 智能体(AI Agent)设
Gemini Spark
Gemini Spark 是 Google 在 2026 年 Google I/O 大会上推出的全天候云端个人 AI 智
NanoClaw
NanoClaw 是您的专属 AI 助手,可安全运行在容器中。轻量设计,易于理解,还能根据您的需求自由定制。 与复杂的
腾讯马维斯marvis
马维斯是腾讯最新推出的操作系统层级AI助手——真正理解你的每一份文件,使用deepseek v4、混元hunyuan3/
超能文献
数野科技(深圳)有限公司专注于将人工智能应用于医学研究,通过智能文献检索、智能文献解读、文档翻译、智能数据统计等AI A
openAI
OpenAI 是一家美国的人工智能研究公司,它本身并不是某一款单一工具,而是一家开发人工智能技术与平台的科技企业。Ope
ChatGPT
ChatGPT应用程序是由OpenAI开发的智能对话工具,利用先进的自然语言处理技术和大模型,模拟人类般的交流体验。用户
AgentGPT
AgentGPT 是能在浏览器中运行的自主人工智能工具。用户通过设定目标(如创建报告、规划旅行或制定学习计划等),Age
纳米AI
纳米AI是360公司推出的新一代超级AI搜索工具,集搜索、写作和创作于一体,重新定义AI搜索体验,纳米AI提供多模态搜索
GitHub Copilot
GitHub Copilot是由GitHub与OpenAI合作开发的一款革命性的智能代码补全和生成工具,旨在帮助开发人员
Cursor
Cursor是Anysphere公司推出的AI代码编辑器,通过集成OpenAI的GPT技术,为用户提供代码生成、编辑、B
用户评论