AI-каталог

Сравнение LLM-моделей

Интерактивная битва нейросетей в стиле Technical.City: прямые бенчмарки, скорость, контекст, аппаратные требования и индекс «цена / качество».

AnthropicКлассический эталон

Claude 3.5 Sonnet

Золотой стандарт программирования и архитектурного анализа

Дата релиза:

Итоговый балл
69.1/ 100
Цена / качество
53.7балл

Сильные стороны Claude 3.5 Sonnet:

  • ✓Выше точность в коде (+6.1% SWE-bench)
  • ✓Шире контекст: 200K токенов
AlibabaЛучший открытый кодер

Qwen 2.5 Coder 32B

Специализированный кодер открытого типа, догоняющий GPT-4o в программировании

Дата релиза:

Итоговый балл
61.1/ 100
Цена / качество
100балл

Сильные стороны Qwen 2.5 Coder 32B:

  • ✓Точнее в олимпиадной математике (78.5% vs 78.3%)
  • ✓Дешевле в 30.0x ($0.2 vs $6 за 1M)
Вердикт сравнения:

Claude 3.5 Sonnet побеждает в тестах с преимуществом 13.1%. Однако Qwen 2.5 Coder 32B выгоднее по цене/качеству в 1.9x.

Методология: Technical.City AI Index

Сравнение в бенчмарках (Technical.City Bars)

Прямое сопоставление результатов тестов по кодингу, математике, логике и следованию инструкциям.

Claude 3.5 Sonnet
Qwen 2.5 Coder 32B
SWE-bench Verified(Решение реальных задач на GitHub)
Claude 3.5 Sonnet +12.8%
Claude 3.5 Sonnet
53.7
Qwen 2.5 Coder 32B
47.6
HumanEval (Python)(Генерация функций без ошибок)
Claude 3.5 Sonnet +1.1%
Claude 3.5 Sonnet
93.7
Qwen 2.5 Coder 32B
92.7
GPQA Diamond(Научные вопросы PhD без подсказок)
Claude 3.5 Sonnet +32%
Claude 3.5 Sonnet
59.4
Qwen 2.5 Coder 32B
45
MATH (Олимпиады)(Олимпиадная математика и доказательства)
Qwen 2.5 Coder 32B +0.3%
Claude 3.5 Sonnet
78.3
Qwen 2.5 Coder 32B
78.5
MMLU-Pro(Академические знания по 57 предметам)
Claude 3.5 Sonnet +18.5%
Claude 3.5 Sonnet
77
Qwen 2.5 Coder 32B
65
IFEval (Инструкции)(Соблюдение жесткого формата и JSON)
Claude 3.5 Sonnet +4.8%
Claude 3.5 Sonnet
87
Qwen 2.5 Coder 32B
83
LMSYS Arena Elo(Слепые A/B тесты пользователей)
Claude 3.5 Sonnet +3.2%
Claude 3.5 Sonnet
1290
Qwen 2.5 Coder 32B
1250

Сравнение по практическим сценариям

Какая модель лучше справляется с конкретными прикладными задачами в реальной работе

💻Лидер: Claude 3.5 Sonnet

Программирование и архитектура

Написание кода, рефакторинг, отладка и автоматизация

Claude 3.5 Sonnet:67.7
Qwen 2.5 Coder 32B:63.4
🧠Лидер: Claude 3.5 Sonnet

Точные науки, математика и логика

Алгоритмы, доказательства, научные гипотезы и reasoning

Claude 3.5 Sonnet:68.8
Qwen 2.5 Coder 32B:61.8
✍️Лидер: Claude 3.5 Sonnet

Эрудиция, тексты и перевод

Академические знания, деловая переписка и статьи

Claude 3.5 Sonnet:81
Qwen 2.5 Coder 32B:72.2
📚Лидер: Claude 3.5 Sonnet

Анализ гигантских документов и RAG

Работа с огромным контекстом, PDF-книгами и базами

Claude 3.5 Sonnet:85.3
Qwen 2.5 Coder 32B:81.8
⚡Лидер: Qwen 2.5 Coder 32B

Скоростные чат-боты и агенты

Отклик в реальном времени, цена за поток и стабильность

Claude 3.5 Sonnet:53.8
Qwen 2.5 Coder 32B:72.5

Технические характеристики и цены (Спецификации)

Сравнение аппаратных параметров, API-цен и скоростных показателей

ПараметрClaude 3.5 SonnetQwen 2.5 Coder 32B
Разработчик / ПровайдерAnthropic Alibaba
Дата релиза
АрхитектураDENSE DENSE (32B)
Доступность весовЗакрытые (API-only) Открытые (Open Weights) ✓
Thinking / Reasoning режимСтандартный (Direct) Стандартный (Direct)
Контекстное окно (вход)200K токенов ✓128K токенов
Максимальный ответ (выход)8.2K токенов 8.2K токенов
Входные модальностиtext, image, pdf text
Цена за 1M входных токенов$3 / 1M $0.2 / 1M ✓
Цена за 1M выходных токенов$15 / 1M $0.2 / 1M ✓
Скорость генерации (токен/сек)~75 t/s ~95 t/s ✓
Задержка до первого токена (TTFT)~550 мс ~350 мс ✓
Кэширование промптов (Prompt Caching)Да (скидка до 90%) ✓Нет

Популярные дуэли нейросетей

Прямые сравнения флагманов и открытых моделей в стиле Technical.City

Главная битва титановVS →

Claude 3.7 Sonnet против GPT-4o

Флагман Anthropic с Thinking Mode против главного мультимодального универсала от OpenAI.

Битва рассужденийVS →

DeepSeek R1 против OpenAI o3-mini

Открытый китайский MoE-гигант против быстрой reasoning-модели OpenAI в математике и коде.

Код против МатематикиVS →

Claude 3.7 Sonnet против DeepSeek R1

Лучшая в мире модель по SWE-bench против лидера олимпиадной математики MATH.

Битва супер-бюджетниковVS →

GPT-4o-mini против Gemini 2.0 Flash

Сравнение двух ультрадешёвых и сверхбыстрых моделей для чат-ботов и интеграций.

Дуэль открытых весовVS →

Llama 3.3 70B против Qwen 2.5 72B

Две лучшие в мире открытые 70B-модели от Meta и Alibaba для собственного сервера.

Контекст 1M vs Гибридный разумVS →

Gemini 2.5 Pro против Claude 3.7 Sonnet

Google с гигантским контекстом против точнейшей логики и глубокого кодинга Anthropic.

Закрытый кодер vs ОткрытыйVS →

Claude 3.5 Sonnet против Qwen 2.5 Coder 32B

Сможет ли 32B открытая модель от Alibaba победить золотой стандарт закрытого кода?