AI-каталог

Сравнение LLM-моделей

Интерактивная битва нейросетей в стиле Technical.City: прямые бенчмарки, скорость, контекст, аппаратные требования и индекс «цена / качество».

DeepSeekКороль открытого reasoning

DeepSeek R1

Революционная открытая reasoning-модель, побеждающая в математике

Дата релиза:

Итоговый балл
75.9/ 100
Цена / качество
100балл

Сильные стороны DeepSeek R1:

  • ✓Выше точность в коде (+0.2% SWE-bench)
  • ✓Точнее в олимпиадной математике (97.3% vs 94.2%)
  • ✓Дешевле в 2.0x ($0.96 vs $1.925 за 1M)
OpenAIЛучшая математика за $

OpenAI o3-mini

Быстрая и экономичная рассуждающая модель для точных наук и кода

Дата релиза:

Итоговый балл
73.5/ 100
Цена / качество
99балл

Сильные стороны OpenAI o3-mini:

  • ✓Шире контекст: 200K токенов
Вердикт сравнения:

DeepSeek R1 побеждает в тестах с преимуществом 3.3%.

Методология: Technical.City AI Index

Сравнение в бенчмарках (Technical.City Bars)

Прямое сопоставление результатов тестов по кодингу, математике, логике и следованию инструкциям.

DeepSeek R1
OpenAI o3-mini
SWE-bench Verified(Решение реальных задач на GitHub)
DeepSeek R1 +0.4%
DeepSeek R1
49.2
OpenAI o3-mini
49
HumanEval (Python)(Генерация функций без ошибок)
DeepSeek R1 +3.3%
DeepSeek R1
96.1
OpenAI o3-mini
93
GPQA Diamond(Научные вопросы PhD без подсказок)
DeepSeek R1 +2.1%
DeepSeek R1
71.5
OpenAI o3-mini
70
MATH (Олимпиады)(Олимпиадная математика и доказательства)
DeepSeek R1 +3.3%
DeepSeek R1
97.3
OpenAI o3-mini
94.2
MMLU-Pro(Академические знания по 57 предметам)
DeepSeek R1 +7%
DeepSeek R1
84
OpenAI o3-mini
78.5
IFEval (Инструкции)(Соблюдение жесткого формата и JSON)
OpenAI o3-mini +1.3%
DeepSeek R1
86.1
OpenAI o3-mini
87.2
LMSYS Arena Elo(Слепые A/B тесты пользователей)
DeepSeek R1 +2.3%
DeepSeek R1
1345
OpenAI o3-mini
1315

Сравнение по практическим сценариям

Какая модель лучше справляется с конкретными прикладными задачами в реальной работе

💻Лидер: DeepSeek R1

Программирование и архитектура

Написание кода, рефакторинг, отладка и автоматизация

DeepSeek R1:65.6
OpenAI o3-mini:64.4
🧠Лидер: DeepSeek R1

Точные науки, математика и логика

Алгоритмы, доказательства, научные гипотезы и reasoning

DeepSeek R1:84.4
OpenAI o3-mini:82.1
✍️Лидер: DeepSeek R1

Эрудиция, тексты и перевод

Академические знания, деловая переписка и статьи

DeepSeek R1:84.8
OpenAI o3-mini:82
📚Лидер: OpenAI o3-mini

Анализ гигантских документов и RAG

Работа с огромным контекстом, PDF-книгами и базами

DeepSeek R1:84.1
OpenAI o3-mini:85.4
⚡Лидер: OpenAI o3-mini

Скоростные чат-боты и агенты

Отклик в реальном времени, цена за поток и стабильность

DeepSeek R1:58.8
OpenAI o3-mini:66.4

Технические характеристики и цены (Спецификации)

Сравнение аппаратных параметров, API-цен и скоростных показателей

ПараметрDeepSeek R1OpenAI o3-mini
Разработчик / ПровайдерDeepSeek OpenAI
Дата релиза
АрхитектураMOE (671B (37B active)) DENSE
Доступность весовОткрытые (Open Weights) ✓Закрытые (API-only)
Thinking / Reasoning режимФиксированный (CoT по умолчанию) Фиксированный (CoT по умолчанию)
Контекстное окно (вход)163.8K токенов 200K токенов ✓
Максимальный ответ (выход)64K токенов 100K токенов ✓
Входные модальностиtext text
Цена за 1M входных токенов$0.55 / 1M ✓$1.1 / 1M
Цена за 1M выходных токенов$2.19 / 1M ✓$4.4 / 1M
Скорость генерации (токен/сек)~50 t/s ~85 t/s ✓
Задержка до первого токена (TTFT)~3800 мс ~2500 мс ✓
Кэширование промптов (Prompt Caching)Да (скидка до 90%) Да (скидка до 90%)

Популярные дуэли нейросетей

Прямые сравнения флагманов и открытых моделей в стиле Technical.City

Главная битва титановVS →

Claude 3.7 Sonnet против GPT-4o

Флагман Anthropic с Thinking Mode против главного мультимодального универсала от OpenAI.

Битва рассужденийVS →

DeepSeek R1 против OpenAI o3-mini

Открытый китайский MoE-гигант против быстрой reasoning-модели OpenAI в математике и коде.

Код против МатематикиVS →

Claude 3.7 Sonnet против DeepSeek R1

Лучшая в мире модель по SWE-bench против лидера олимпиадной математики MATH.

Битва супер-бюджетниковVS →

GPT-4o-mini против Gemini 2.0 Flash

Сравнение двух ультрадешёвых и сверхбыстрых моделей для чат-ботов и интеграций.

Дуэль открытых весовVS →

Llama 3.3 70B против Qwen 2.5 72B

Две лучшие в мире открытые 70B-модели от Meta и Alibaba для собственного сервера.

Контекст 1M vs Гибридный разумVS →

Gemini 2.5 Pro против Claude 3.7 Sonnet

Google с гигантским контекстом против точнейшей логики и глубокого кодинга Anthropic.

Закрытый кодер vs ОткрытыйVS →

Claude 3.5 Sonnet против Qwen 2.5 Coder 32B

Сможет ли 32B открытая модель от Alibaba победить золотой стандарт закрытого кода?