← max_tokens

$ big_bench run --all-models --one-shot

big_bench

бенчмарк, который можно потрогать: один промпт — все модели, живые артефакты, реальные цены. никакого MMLU.

12 моделей · 1 тест · 0 авторетраев · $5.96 api

Сводный зачёт

Очки начисляются за место в каждом тесте по схеме 10, 7, 5, 3, 2, 1; места ниже этой схемы не получают ничего. Зачёт пересчитывается после каждого нового теста.

#модельpts
01 claude-opus-5🏆 10
02 gpt-5.6-sol 7
03 qwen3.8-max 5
04 gpt-5.5 3
05 claude-fable-5 2
06 deepseek-v4-pro 1
07 kimi-k3 0
08 gemini-3.1-pro 0
09 claude-opus-4-8 0
10 grok-4.5 0
11 claude-opus-4-6 0
12 qwen3.7-max 0

Тесты

11 июл 20263d Бигмак-тест: двенадцать моделей, один Биг Мак winner: claude-opus-5
скоро в работе? следующий тест логика? часы? тетрис? — на подходе.