AI模型评测相关推荐
PubMedQA
PubMedQA是专门用在生物医学研究问题回答的数据集。PubMedQA通过文献摘要回答“是/否/可能”形式的研究问题,
H2O EvalGPT
H2O EvalGPT 是 H2O.ai 用于评估和比较 LLM 大模型的开放工具,它提供了一个平台来了解模型在大量任务
LLMEval3
LLMEval是由复旦大学NLP实验室推出的大模型评测基准,最新的LLMEval-3聚焦于专业知识能力评测,涵盖哲学、经
LMArena
LMArena是加州大学伯克利分校推出的创新AI模型评估平台,基于让用户对不同AI模型的回答进行匿名投票,衡量模型的表现
HELM
HELM是由斯坦福大学推出的大模型评测体系,该评测方法主要包括场景、适配、指标三个模块,每次评测的运行都需要指定一个场景
MMBench
MMBench是多模态基准测试,由上海人工智能实验室、南洋理工大学、香港中文大学、新加坡国立大学和浙江大学的研究人员联合
CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
OpenCompass
OpenCompass是上海人工智能实验室(上海AI实验室)于2023年8月正式推出的大模型开放评测体系,通过完整开源可
AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造
SuperCLUE
SuperCLUE 是针对中文大模型的综合性评测基准,能全面评估模型在多个维度上的性能表现。SuperCLUE 通过多轮
FlagEval
FlagEval(天秤)是北京智源人工智能研究院(BAAI)推出的科学、公正、开放的大模型评测体系及开放平台,为研究人员
C-Eval
C-Eval是一个适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5
AI小编推荐
Ask YouTube
Ask YouTube 是谷歌为YouTube平台推出的一项AI 对话式搜索功能。它将传统的关键词搜索升级为类似智能聊天
Alipay AI Pay
支付宝 AI 付(Alipay AI Pay)是支付宝面向 AI 时代推出的一项专为 AI 智能体(AI Agent)设
Gemini Spark
Gemini Spark 是 Google 在 2026 年 Google I/O 大会上推出的全天候云端个人 AI 智
NanoClaw
NanoClaw 是您的专属 AI 助手,可安全运行在容器中。轻量设计,易于理解,还能根据您的需求自由定制。 与复杂的
腾讯马维斯marvis
马维斯是腾讯最新推出的操作系统层级AI助手——真正理解你的每一份文件,使用deepseek v4、混元hunyuan3/
超能文献
数野科技(深圳)有限公司专注于将人工智能应用于医学研究,通过智能文献检索、智能文献解读、文档翻译、智能数据统计等AI A
openAI
OpenAI 是一家美国的人工智能研究公司,它本身并不是某一款单一工具,而是一家开发人工智能技术与平台的科技企业。Ope
ChatGPT
ChatGPT应用程序是由OpenAI开发的智能对话工具,利用先进的自然语言处理技术和大模型,模拟人类般的交流体验。用户
AgentGPT
AgentGPT 是能在浏览器中运行的自主人工智能工具。用户通过设定目标(如创建报告、规划旅行或制定学习计划等),Age
纳米AI
纳米AI是360公司推出的新一代超级AI搜索工具,集搜索、写作和创作于一体,重新定义AI搜索体验,纳米AI提供多模态搜索
GitHub Copilot
GitHub Copilot是由GitHub与OpenAI合作开发的一款革命性的智能代码补全和生成工具,旨在帮助开发人员
Cursor
Cursor是Anysphere公司推出的AI代码编辑器,通过集成OpenAI的GPT技术,为用户提供代码生成、编辑、B
用户评论