大语言模型基准测试全解:GLUE/HumanEval/MT-Bench等评测方法与主流公开榜单对比

评估语言模型的性能对于评估其质量和确定需要改进的领域至关重要。传统上, 语言模型的评估指标侧重于特定于任务的性能, 例如准确性、F1 分数和困惑度。这些指标用于评估专为特定任务(如文本分类、命名实体识别和机器翻译)设计的模型。

LLMs的能力可以推广到广泛的NLP任务, 这要求研究人员设计全面的评估基准, 以有效地测试他们在各种任务上的能力。这些基准测试应该涵盖 LLM 的全部功能, 同时足够简单, 易于管理和解释。

Embedding Leaderboard

xbench Leaderboard

LLM Leaderboard

LLM Leaderboard - Compare GPT-4o, Llama 3, Mistral, Gemini & other models | Artificial Analysis

LiveCodeBench

Aider LLM Leaderboards

Chatbot Arena LLM Leaderboard

Chatbot Arena (formerly LMSYS): Free AI Chat to Compare & Test Best AI Chatbots

SuperCLUE

SuperCLUE

BigCodeBench Leaderboard

BigCodeBench Leaderboard

1. 简介

1.1 评测方向

综合能力(得分的平均值)

  • 分类能力
  • 信息抽取能力
  • 阅读理解能力
  • 数据分析能力

    1.2 评测方法

    1.2.1 GLUE

    是NLU任务的的评测基准, 通用语言理解评估基准。评估了语言模型在广泛的现有 NLU 任务中的性能, 从情感分析到文本蕴涵等。GLUE 不会对模型架构施加限制, 允许探索各种方法和技术。唯一的要求是能够处理单句和句子对输入并生成相应的预测。
    SuperGLUE提出了一组新的更具挑战性的语言任务, 突破了NLU模型所能实现的界限。SuperGLUE的创建是为了通过向NLU模型提供更具挑战性的任务来扩展它们可以实现的边界。它建立在GLUE奠定的基础之上, 继续强调多样化的语言任务和对语言现象的广泛覆盖。

    1.2.2 HumanEval

    是一个用于评估代码生成模型性能的数据集, 由OpenAI在2021年推出。这个数据集包含164个手工编写的编程问题, 每个问题都包括一个函数签名、文档字符串(docstring)、函数体以及几个单元测试。

    1.2.3 MBPP

    MBPP(Mostly Basic Programming Problems)是一个数据集, 主要包含了974个短小的Python函数问题, 由谷歌在2021年推出, 这些问题主要是为初级程序员设计的, 结果通过pass@k表示, 其中k表示模型一次性生成多少种不同的答案中, 至少包含1个正确的结果。

    1.2.4 IFEval

    IFEval 是一个简单易行的评估基准。它侧重于一组”可验证的指令”, 例如”写出400字以上”和”至少提及AI关键字3次”。我们确定了 25 种类型的可验证指令, 并构建了大约 500 个提示, 每个提示都包含一个或多个可验证指令。

    1.2.5 MT Bench

    MT Bench也称为”多轮基准测试”, 是一种评估大型语言模型(LLM) 的方法。该基准测试提供了对 LLM 性能的详细分析, 特别关注它们在多轮对话中管理对话流和遵循指令的能力。它围绕 80 个多回合问题构建, 每个问题都旨在评估对话中 LLM 的深度。它涵盖了许多类别, 包括写作、推理、编码和科学, 确保了全面的法学硕士评估。

    1.2.6 AGIEval

    AGIEval: 以人为本的评估基础模型的基准。专门设计用于在以人为本的标准化考试(如高考、法学院入学考试、数学竞赛和律师资格考试)的背景下评估基础模型。
    AGIEval基准(Zhong等人, 2023)包含了来自中国高考、中国律师资格考试和中国公务员考试的数据。

    1.2.7 BIG-bench

    Beyond the Imitation Game Benchmark(BIG-bench)是一个全面的评估框架, 旨在评估语言模型在各种任务中的能力和局限性。BIG-bench 目前包括来自 132 个机构的 444 位作者贡献的 204 项任务, 重点关注语言学、儿童发展、数学、常识推理、生物学、物理学、社会偏见和软件开发等不同主题。
    BBH(BIG-Bench Hard): 是 BIG-Bench 的一个子集, BIG-Bench 是一个用于语言模型的多样化评估套件。BBH 专注于 BIG-Bench 的 23 个具有挑战性的任务, 这些任务被发现超出了当前语言模型的能力。在这些任务中, 先前的语言模型评估没有优于普通的人类评估者。BBH 任务需要多步骤推理, 并且发现没有思维链(CoT) 的少量提示, 就像在 BIG-Bench 评估中所做的那样, 大大低估了语言模型的最佳性能和能力。当 CoT 提示应用于 BBH 任务时, 它使 PaLM 在 23 个任务中的 10 个任务中超过了人类评分者的平均表现, 而 Codex 在 23 个任务中的 17 个任务上超过了人类评分者的平均表现。

    1.2.8 其他

  • GSM8K(小学数学)
  • MMLU(多学科问答): 供了从真实世界的考试和书籍中收集的多领域和多任务评价。
  • HELM基准: 汇总了42个不同的任务, 用从准确性到鲁棒性的7个指标来评估LLMs。
  • AI2 推理挑战(ARC) - ARC 评估模型回答复杂问题的能力, 这些问题需要更深入的知识和推理, 而不仅仅是检索。它有大约 7.5k 个来自小学科学的问题, 它通过要求推理、常识和深入的文本理解来推动人工智能的进步。
  • HellaSwag - HellaSwag 评估 AI 中的常识, 尤其是在以有意义的方式完成句子和段落方面.
  • TruthfulQA - 该基准测试旨在衡量语言模型在回答各种问题时的准确性, 涵盖 38 个类别的 817 个问题, 重点关注反映训练数据中常见误解的误导性回答。
  • CLUE基准(Xu等人, 2020)是第一个大规模的中文NLU基准, 现在仍然是使用最广泛和最好的中文基准。
  • MMCU基准(Zeng, 2023)包括来自医学、法律、心理学和教育等四大领域的测试, 这些数据也是从中国高考、资格考试以及大学考试中收集的。
  • LLM Creativity 基准: 评估大型语言模型用作未经审查的创意写作助手的能力

    2. 公开榜单

    榜单类型排行榜备注
    C-Eval中文指令榜单checked
    OpenCompass中文指令榜单
    SuperCLUE中文指令榜单
    FlagEval中文指令榜单
    EvalPlus Leaderboard代码榜单checked
    code-generation-on-humaneval代码榜单
    Open LLM Leaderboard指令榜单
    AlpacaEval Leaderboard指令榜单
    LMSYS ORG指令榜单
    ConTextual Leaderboard对包含文本的图像进行解析/推理榜单
    LMSYS LeaderboardChatbot Arena榜单
    vellum Leaderboardmath-science-reasoning榜单
    mteb LeaderboardEmbedding榜单
    bigcode Leaderboard代码榜单
    can-ai-code代码榜单
    UGI LeaderboardGeneral榜单
    TTS-ArenaTTS榜单
    open_asrTTS榜单
    open_medical_llm医学模型榜单
    livecodebench代码榜单, https://livecodebench.github.io/leaderboard.html
    Berkeley Function-Calling LeaderboardFunction Call榜单
    open_vlm LeaderboardVISION榜单

2.1 Other

RULER: 你的长上下文语言模型的实际上下文大小是多少?
RULER相关论文: RULER: What’s the Real Context Size of Your Long-Context Language Models
尽管在普通大海捞针(NIAH)测试中取得了近乎完美的性能, 但随着序列长度的增加, 所有型号(Gemini-1.5-pro除外)在RULER中的任务都表现出很大的退化。

4.3 DataSet

本文结束 感谢您的阅读