← big_bench

Бигмак-тест: двенадцать моделей, один Биг Мак

Один промпт, никаких правок: что вернулось — то и опубликовано — живые артефакты в песочнице (крутите мышью), метрики и цены.

Промпт

promptCreate a 3D visualization of a Big Mac in three.js. The burger slowly rotates on its own; the camera can orbit and zoom. Make it as photorealistic as possible.

Technical requirements: a single self-contained HTML file; load three.js from a CDN; the scene fills the entire browser window and adapts to its size; no localStorage, cookies, or network requests beyond CDN libraries. Return only the finished HTML file as a single code block, with no text before or after.

Результаты

Score — взвешенная сумма: 0.4 сходство с Биг Маком, 0.3 качество рендера, 0.2 интерактивность, 0.1 первый запуск. Очки начисляются за место в этом тесте по схеме 10, 7, 5, 3, 2, 1; места ниже этой схемы не получают ничего. Равный score места не делит: выше встаёт тот, кто дешевле; при равной цене — кто быстрее; последний ключ — снапшот по алфавиту.

#модельscoreочкиценаvalueвремя
01 claude-opus-5🏆 0.875 +10 $1.31 0.7 617s
02 gpt-5.6-sol 0.840 +7 $0.36 2.3 141s
03 qwen3.8-max 0.830 +5 $0.22 3.8 751s
04 gpt-5.5 0.800 +3 $0.63 1.3 238s
05 claude-fable-5 0.745 +2 $0.98 0.8 234s
06 deepseek-v4-pro 0.740 +1 $0.03 25.9 403s
07 kimi-k3 0.705 $0.53 1.3 1162s
08 gemini-3.1-pro 0.640 $0.16 3.9 99s
09 claude-opus-4-8 0.635 $0.15 4.3 57s
10 grok-4.5 0.615 $0.07 8.7 68s
11 claude-opus-4-6 0.530 $1.49 0.4 864s
12 qwen3.7-maxне отрисовался 0.000 $0.03 0.0 149s
итого $5.96 79:43

value = score ÷ цена (за один прогон) — грубая прикидка «сколько балла за доллар». score наполовину субъективен, а цена шумит между прогонами, так что это ориентир, не точная метрика. Разрыв при этом реальный: deepseek отстаёт от победителя на 0.14 балла при ~сороковой части цены.

Сравнение двоих

По умолчанию победитель против самого выгодного; в меню — любая пара.

условия и версии прогона

12/12 ответили · 299.8k tok · $5.96 · 84:42 wall

one-shot · single-delivery · temperature default · reasoning high · max_tokens без лимита · 2026-07-11

как считается score. сходство с Биг Маком и качество рендера ставит владелец вручную, глазами, по рубрике 0–1. первый запуск и интерактивность — автоматическая проба в headless-браузере (запустился без ошибок + реагирует на drag). Субъективная часть раскрыта честно: это авторский суд, а не «объективная» цифра — значит и порядок мест, и колонка value наследуют эту субъективность.

перезапущены владельцем: первая попытка не дала рабочего артефакта (пригодного ответа не пришло / обрезано потолком / битый ответ), результат — повторный запуск, single-delivery соблюдён в каждой попытке: kimi-k3, claude-opus-5

snapshots: claude-opus-4-8=anthropic/claude-opus-4.8 · claude-opus-4-6=anthropic/claude-opus-4.6 · claude-fable-5=anthropic/claude-fable-5 · gpt-5.5=openai/gpt-5.5 · gpt-5.6-sol=openai/gpt-5.6-sol · gemini-3.1-pro=google/gemini-3.1-pro-preview · grok-4.5=x-ai/grok-4.5 · qwen3.7-max=qwen/qwen3.7-max · deepseek-v4-pro=deepseek/deepseek-v4-pro · kimi-k3=moonshotai/kimi-k3 · claude-opus-5=anthropic/claude-opus-5 · qwen3.8-max=qwen/qwen3.8-max