$ big_bench run --all-models --one-shot
big_bench
бенчмарк, который можно потрогать: один промпт — все модели, живые артефакты, реальные цены. никакого MMLU.
✓ 13 моделей · 1 тест · 0 авторетраев · $8.64 api
Сводный зачёт
Очки начисляются за место в каждом тесте по схеме 10, 7, 5, 3, 2, 1; места ниже этой схемы не получают ничего. Зачёт пересчитывается после каждого нового теста.
| # | модель | pts |
|---|---|---|
| 01 | claude-fable-5-1🏆 | 10 |
| 02 | claude-opus-5 | 7 |
| 03 | gpt-5.6-sol | 5 |
| 04 | qwen3.8-max | 3 |
| 05 | gpt-5.5 | 2 |
| 06 | claude-fable-5 | 1 |
| 07 | deepseek-v4-pro | 0 |
| 08 | kimi-k3 | 0 |
| 09 | gemini-3.1-pro | 0 |
| 10 | claude-opus-4-8 | 0 |
| 11 | grok-4.5 | 0 |
| 12 | claude-opus-4-6 | 0 |
| 13 | qwen3.7-max | 0 |
Тесты
11 июл 20263d Бигмак-тест: двенадцать моделей, один Биг Мак winner: claude-fable-5-1
скоро в работе? следующий тест логика? часы? тетрис? — на подходе.