AI-каталог

Сравнение LLM-моделей

Интерактивная битва нейросетей в стиле Technical.City: прямые бенчмарки, скорость, контекст, аппаратные требования и индекс «цена / качество».

OpenAIВыбор для чат-ботов

GPT-4o-mini

Сверхдешёвая рабочая лошадка для ботов, суммаризации и интеграций

Дата релиза:

Итоговый балл
55.3/ 100
Цена / качество
100балл
GoogleСкорость и мультимодал

Gemini 2.0 Flash

Молниеносная мультимодальная модель с контекстом 1M токенов

Дата релиза:

Итоговый балл
61/ 100
Цена / качество
100балл

Сильные стороны Gemini 2.0 Flash:

  • ✓Выше точность в коде (+4% SWE-bench)
  • ✓Точнее в олимпиадной математике (74% vs 70.2%)
  • ✓Дешевле в 1.5x ($0.175 vs $0.2625 за 1M)
  • ✓Шире контекст: 1049K токенов
Вердикт сравнения:

Gemini 2.0 Flash побеждает в тестах с преимуществом 9.3%.

Методология: Technical.City AI Index

Сравнение в бенчмарках (Technical.City Bars)

Прямое сопоставление результатов тестов по кодингу, математике, логике и следованию инструкциям.

GPT-4o-mini
Gemini 2.0 Flash
SWE-bench Verified(Решение реальных задач на GitHub)
Gemini 2.0 Flash +9.5%
GPT-4o-mini
38
Gemini 2.0 Flash
42
HumanEval (Python)(Генерация функций без ошибок)
Gemini 2.0 Flash +1%
GPT-4o-mini
86.6
Gemini 2.0 Flash
87.5
GPQA Diamond(Научные вопросы PhD без подсказок)
Gemini 2.0 Flash +16.2%
GPT-4o-mini
40.2
Gemini 2.0 Flash
48
MATH (Олимпиады)(Олимпиадная математика и доказательства)
Gemini 2.0 Flash +5.1%
GPT-4o-mini
70.2
Gemini 2.0 Flash
74
MMLU-Pro(Академические знания по 57 предметам)
Gemini 2.0 Flash +9.1%
GPT-4o-mini
62
Gemini 2.0 Flash
68.2
IFEval (Инструкции)(Соблюдение жесткого формата и JSON)
Gemini 2.0 Flash +2.8%
GPT-4o-mini
84
Gemini 2.0 Flash
86.4
LMSYS Arena Elo(Слепые A/B тесты пользователей)
Gemini 2.0 Flash +3.2%
GPT-4o-mini
1220
Gemini 2.0 Flash
1260

Сравнение по практическим сценариям

Какая модель лучше справляется с конкретными прикладными задачами в реальной работе

💻Лидер: Gemini 2.0 Flash

Программирование и архитектура

Написание кода, рефакторинг, отладка и автоматизация

GPT-4o-mini:55
Gemini 2.0 Flash:57.9
🧠Лидер: Gemini 2.0 Flash

Точные науки, математика и логика

Алгоритмы, доказательства, научные гипотезы и reasoning

GPT-4o-mini:55.2
Gemini 2.0 Flash:61
✍️Лидер: Gemini 2.0 Flash

Эрудиция, тексты и перевод

Академические знания, деловая переписка и статьи

GPT-4o-mini:70.8
Gemini 2.0 Flash:75.5
📚Лидер: Gemini 2.0 Flash

Анализ гигантских документов и RAG

Работа с огромным контекстом, PDF-книгами и базами

GPT-4o-mini:82.2
Gemini 2.0 Flash:91.9
⚡Лидер: Gemini 2.0 Flash

Скоростные чат-боты и агенты

Отклик в реальном времени, цена за поток и стабильность

GPT-4o-mini:85.1
Gemini 2.0 Flash:96.9

Технические характеристики и цены (Спецификации)

Сравнение аппаратных параметров, API-цен и скоростных показателей

ПараметрGPT-4o-miniGemini 2.0 Flash
Разработчик / ПровайдерOpenAI Google
Дата релиза
АрхитектураDENSE DENSE
Доступность весовЗакрытые (API-only) Закрытые (API-only)
Thinking / Reasoning режимСтандартный (Direct) Стандартный (Direct)
Контекстное окно (вход)128K токенов 1M токенов ✓
Максимальный ответ (выход)16.4K токенов ✓8.2K токенов
Входные модальностиtext, image text, image, audio, video, pdf
Цена за 1M входных токенов$0.15 / 1M $0.1 / 1M ✓
Цена за 1M выходных токенов$0.6 / 1M $0.4 / 1M ✓
Скорость генерации (токен/сек)~140 t/s ~180 t/s ✓
Задержка до первого токена (TTFT)~320 мс ~250 мс ✓
Кэширование промптов (Prompt Caching)Да (скидка до 90%) Да (скидка до 90%)

Популярные дуэли нейросетей

Прямые сравнения флагманов и открытых моделей в стиле Technical.City

Главная битва титановVS →

Claude 3.7 Sonnet против GPT-4o

Флагман Anthropic с Thinking Mode против главного мультимодального универсала от OpenAI.

Битва рассужденийVS →

DeepSeek R1 против OpenAI o3-mini

Открытый китайский MoE-гигант против быстрой reasoning-модели OpenAI в математике и коде.

Код против МатематикиVS →

Claude 3.7 Sonnet против DeepSeek R1

Лучшая в мире модель по SWE-bench против лидера олимпиадной математики MATH.

Битва супер-бюджетниковVS →

GPT-4o-mini против Gemini 2.0 Flash

Сравнение двух ультрадешёвых и сверхбыстрых моделей для чат-ботов и интеграций.

Дуэль открытых весовVS →

Llama 3.3 70B против Qwen 2.5 72B

Две лучшие в мире открытые 70B-модели от Meta и Alibaba для собственного сервера.

Контекст 1M vs Гибридный разумVS →

Gemini 2.5 Pro против Claude 3.7 Sonnet

Google с гигантским контекстом против точнейшей логики и глубокого кодинга Anthropic.

Закрытый кодер vs ОткрытыйVS →

Claude 3.5 Sonnet против Qwen 2.5 Coder 32B

Сможет ли 32B открытая модель от Alibaba победить золотой стандарт закрытого кода?