AI-каталог

Сравнение LLM-моделей

Интерактивная битва нейросетей в стиле Technical.City: прямые бенчмарки, скорость, контекст, аппаратные требования и индекс «цена / качество».

MetaСтандарт Open Source

Llama 3.3 70B Instruct

Главная открытая рабочая лошадка индустрии с качеством уровня GPT-4

Дата релиза:

Итоговый балл
60.3/ 100
Цена / качество
100балл
AlibabaЛидер открытой математики

Qwen 2.5 72B Instruct

Сильнейшая китайская открытая модель в математике, коде и мультиязычности

Дата релиза:

Итоговый балл
63.8/ 100
Цена / качество
100балл

Сильные стороны Qwen 2.5 72B Instruct:

  • ✓Выше точность в коде (+5% SWE-bench)
  • ✓Точнее в олимпиадной математике (83.1% vs 73.1%)
  • ✓Дешевле в 1.1x ($0.3625 vs $0.4 за 1M)
Вердикт сравнения:

Qwen 2.5 72B Instruct побеждает в тестах с преимуществом 5.5%.

Методология: Technical.City AI Index

Сравнение в бенчмарках (Technical.City Bars)

Прямое сопоставление результатов тестов по кодингу, математике, логике и следованию инструкциям.

Llama 3.3 70B Instruct
Qwen 2.5 72B Instruct
SWE-bench Verified(Решение реальных задач на GitHub)
Qwen 2.5 72B Instruct +11.4%
Llama 3.3 70B Instruct
39
Qwen 2.5 72B Instruct
44
HumanEval (Python)(Генерация функций без ошибок)
Llama 3.3 70B Instruct +2.3%
Llama 3.3 70B Instruct
88.4
Qwen 2.5 72B Instruct
86.4
GPQA Diamond(Научные вопросы PhD без подсказок)
Llama 3.3 70B Instruct +0.6%
Llama 3.3 70B Instruct
49.3
Qwen 2.5 72B Instruct
49
MATH (Олимпиады)(Олимпиадная математика и доказательства)
Qwen 2.5 72B Instruct +12%
Llama 3.3 70B Instruct
73.1
Qwen 2.5 72B Instruct
83.1
MMLU-Pro(Академические знания по 57 предметам)
Qwen 2.5 72B Instruct +3.5%
Llama 3.3 70B Instruct
69.5
Qwen 2.5 72B Instruct
72
IFEval (Инструкции)(Соблюдение жесткого формата и JSON)
Llama 3.3 70B Instruct +0.6%
Llama 3.3 70B Instruct
86
Qwen 2.5 72B Instruct
85.5
LMSYS Arena Elo(Слепые A/B тесты пользователей)
Qwen 2.5 72B Instruct +1.2%
Llama 3.3 70B Instruct
1255
Qwen 2.5 72B Instruct
1270

Сравнение по практическим сценариям

Какая модель лучше справляется с конкретными прикладными задачами в реальной работе

💻Лидер: Qwen 2.5 72B Instruct

Программирование и архитектура

Написание кода, рефакторинг, отладка и автоматизация

Llama 3.3 70B Instruct:56.3
Qwen 2.5 72B Instruct:58.8
🧠Лидер: Qwen 2.5 72B Instruct

Точные науки, математика и логика

Алгоритмы, доказательства, научные гипотезы и reasoning

Llama 3.3 70B Instruct:61.2
Qwen 2.5 72B Instruct:66
✍️Лидер: Qwen 2.5 72B Instruct

Эрудиция, тексты и перевод

Академические знания, деловая переписка и статьи

Llama 3.3 70B Instruct:76.1
Qwen 2.5 72B Instruct:77.4
📚Лидер: Llama 3.3 70B Instruct

Анализ гигантских документов и RAG

Работа с огромным контекстом, PDF-книгами и базами

Llama 3.3 70B Instruct:83
Qwen 2.5 72B Instruct:82.8
⚡Лидер: Llama 3.3 70B Instruct

Скоростные чат-боты и агенты

Отклик в реальном времени, цена за поток и стабильность

Llama 3.3 70B Instruct:71.2
Qwen 2.5 72B Instruct:68.5

Технические характеристики и цены (Спецификации)

Сравнение аппаратных параметров, API-цен и скоростных показателей

ПараметрLlama 3.3 70B InstructQwen 2.5 72B Instruct
Разработчик / ПровайдерMeta Alibaba
Дата релиза
АрхитектураDENSE (70B) DENSE (72B)
Доступность весовОткрытые (Open Weights) Открытые (Open Weights)
Thinking / Reasoning режимСтандартный (Direct) Стандартный (Direct)
Контекстное окно (вход)128K токенов 128K токенов
Максимальный ответ (выход)8.2K токенов 8.2K токенов
Входные модальностиtext text
Цена за 1M входных токенов$0.4 / 1M $0.35 / 1M ✓
Цена за 1M выходных токенов$0.4 / 1M $0.4 / 1M
Скорость генерации (токен/сек)~90 t/s ✓~80 t/s
Задержка до первого токена (TTFT)~420 мс ✓~450 мс
Кэширование промптов (Prompt Caching)Нет Нет

Популярные дуэли нейросетей

Прямые сравнения флагманов и открытых моделей в стиле Technical.City

Главная битва титановVS →

Claude 3.7 Sonnet против GPT-4o

Флагман Anthropic с Thinking Mode против главного мультимодального универсала от OpenAI.

Битва рассужденийVS →

DeepSeek R1 против OpenAI o3-mini

Открытый китайский MoE-гигант против быстрой reasoning-модели OpenAI в математике и коде.

Код против МатематикиVS →

Claude 3.7 Sonnet против DeepSeek R1

Лучшая в мире модель по SWE-bench против лидера олимпиадной математики MATH.

Битва супер-бюджетниковVS →

GPT-4o-mini против Gemini 2.0 Flash

Сравнение двух ультрадешёвых и сверхбыстрых моделей для чат-ботов и интеграций.

Дуэль открытых весовVS →

Llama 3.3 70B против Qwen 2.5 72B

Две лучшие в мире открытые 70B-модели от Meta и Alibaba для собственного сервера.

Контекст 1M vs Гибридный разумVS →

Gemini 2.5 Pro против Claude 3.7 Sonnet

Google с гигантским контекстом против точнейшей логики и глубокого кодинга Anthropic.

Закрытый кодер vs ОткрытыйVS →

Claude 3.5 Sonnet против Qwen 2.5 Coder 32B

Сможет ли 32B открытая модель от Alibaba победить золотой стандарт закрытого кода?