← max_tokens

$ big_bench run --all-models --one-shot

big_bench

бенчмарк, который можно потрогать: один промпт — все модели, живые артефакты, реальные цены. никакого MMLU.

✓ 13 моделей · 1 тест · 0 авторетраев · $8.64 api

Сводный зачёт

Очки начисляются за место в каждом тесте по схеме 10, 7, 5, 3, 2, 1; места ниже этой схемы не получают ничего. Зачёт пересчитывается после каждого нового теста.

#модельpts
01 claude-fable-5-1🏆 10
02 claude-opus-5 7
03 gpt-5.6-sol 5
04 qwen3.8-max 3
05 gpt-5.5 2
06 claude-fable-5 1
07 deepseek-v4-pro 0
08 kimi-k3 0
09 gemini-3.1-pro 0
10 claude-opus-4-8 0
11 grok-4.5 0
12 claude-opus-4-6 0
13 qwen3.7-max 0

Тесты

11 июл 20263d Бигмак-тест: двенадцать моделей, один Биг Мак winner: claude-fable-5-1
скоро в работе? следующий тест логика? часы? тетрис? — на подходе.