AIの賢さをどう測るのか、評価やベンチマークの用語です。
収録55語- Agent Arena エージェントアリーナ
- AgentWorldBench
- AlpacaEval
- ARC-AGI アークエージーアイ
- Arena-Hard アリーナハード
- Automated Grader
- Benchmaxxing ベンチマックス
- BFCL ビーエフシーエル
- BIG-Bench Hard
- Chatbot Arena チャットボットアリーナ
- CoffeeBench コーヒーベンチ
- DeepSeek-ProverBench
- Eloレーティング
- Expert Graders
- FrontierMath
- GAIA ガイア
- GDPval
- GDPval Gold Set
- GeneBench-Pro ジーンベンチプロ
- GPQA ジーピーキューエー
- HELM ヘルム
- HumanEval
- Humanity's Last Exam
- IFEval
- LifeSciBench ライフサイベンチ
- LiveBench ライブベンチ
- LiveCodeBench
- LLM-as-a-Judge
- MathVista
- MGSM エムジーエスエム
- MLPerf エムエルパーフ
- MMLU エムエムエルユー
- MMLU-Pro エムエムエルユープロ
- MMMU エムエムエムユー
- MMMU-Pro エムエムエムユープロ
- MT-Bench エムティーベンチ
- Needle in a Haystack
- One-Shot Evaluation
- OpenAI Evals オープンエーアイイーバルズ
- OSWorld オーエスワールド
- pass@k パスアットケー
- Qwen-Image-Bench
- RAGAS
- RewardBench リワードベンチ
- SimpleQA シンプルキューエー
- SOTA
- SWE-bench
- TruthfulQA
- τ-bench
- ジャギッドインテリジェンス
- 生成AI評価 せいせいえーあいひょうか
- データ汚染 でーたおせん
- ベンチマーク
- ポチョムキン理解
- ロングホライズンタスク