$ big_bench run --all-models --one-shot
big_bench
бенчмарк, который можно потрогать: один промпт — все модели, живые артефакты, реальные цены. никакого MMLU.
✓ 12 моделей · 1 тест · 0 авторетраев · $5.96 api
Сводный зачёт
Очки начисляются за место в каждом тесте по схеме 10, 7, 5, 3, 2, 1; места ниже этой схемы не получают ничего. Зачёт пересчитывается после каждого нового теста.
| # | модель | pts |
|---|---|---|
| 01 | claude-opus-5🏆 | 10 |
| 02 | gpt-5.6-sol | 7 |
| 03 | qwen3.8-max | 5 |
| 04 | gpt-5.5 | 3 |
| 05 | claude-fable-5 | 2 |
| 06 | deepseek-v4-pro | 1 |
| 07 | kimi-k3 | 0 |
| 08 | gemini-3.1-pro | 0 |
| 09 | claude-opus-4-8 | 0 |
| 10 | grok-4.5 | 0 |
| 11 | claude-opus-4-6 | 0 |
| 12 | qwen3.7-max | 0 |
Тесты
11 июл 20263d Бигмак-тест: двенадцать моделей, один Биг Мак winner: claude-opus-5
скоро в работе? следующий тест логика? часы? тетрис? — на подходе.