АНАЛИЗ ВЛИЯНИЯ МЕТОДОВ КВАНТОВАНИЯ НА КАЧЕСТВО РАБОТЫ LLM МОДЕЛЕЙ
Конференция: XCVIII Международная научно-практическая конференция «Научный форум: инновационная наука»
Секция: Технические науки

XCVIII Международная научно-практическая конференция «Научный форум: инновационная наука»
АНАЛИЗ ВЛИЯНИЯ МЕТОДОВ КВАНТОВАНИЯ НА КАЧЕСТВО РАБОТЫ LLM МОДЕЛЕЙ
1. Введение
В последнее время все больше и больше людей используют большие языковые модели в своей ежедневной работе. Использование моделей позволяет сократить время тратимое сотрудниками на рутинные задачи и повысить итоговую эффективность. Но организации предоставляющие услуги чат ботов требуют денежные средства за использование и «подсаживают» на подписки.
Недавно пользователям представилась возможность получить доступ к большим языковым моделям развернутых локально на обычном персональном компьютере или сервере. К сожалению, большие языковые модели все еще недоступны обычным пользователям из-за требуемого огромного количества вычислительных ресурсов, в особенности в условиях постоянного роста объема параметров.
Решением такой задачи, является квантование весов модели. Llama.cpp поддерживает разные виды квантования. Обычно качество таких моделей оценивается через перплексию или через агрегированные бенчмарки. Однако эти метрики не всегда способны отразить искажения моделей в указании фактов или в логических размышлениях.
Цель данной работы - экспериментально оценить влияние различных уровней GGUF (GPT-Generated Unified Format) квантования на точность вывода конкретной модели.
2. Уровни квантования
Существует два основных разделения методов квантования - Q и I. Q‑квантование (Quantile‑based Quantization) - квантование использующее квантили распределения для более точного подбора диапазона и шага, таким образом сохраняя качество модели.
I‑квантование (Integer Quantization) - целочисленное квантование, в котором значения весов округляют до ближайшего целочисленного знака. Это позволяет эффективнее работать на ускорителях поддерживающих целочисленные вычисления, но обеспечивает большую потерю точности, чем Q-квантование.
Данная работа охватывает следующие основные уровни квантования:
- Q8_0
- Q5_K_M
- Q4_K_S
- IQ4_NL
- IQ3_XS
- Q2_K
3. Методика тестирования
Тесты влияния уровней квантования проводятся на собственном наборе тестовых вопросов. Набор состоит из 220 вопросов по различным сферам таким как: география, история, математика, программирование, литература.
Каждой модели прибавляется один балл, если она, верно, отвечает на вопрос. В случае если модель не правильно ответила на вопрос, модели не хватило контекстного окна для ответа или произошла галлюцинация - балл не засчитывается.
После этого все полученные баллы модели суммируются, а итоговая оценка рассчитывается по формуле
, где x - итоговая оценка,
- количество верно отвеченных вопросов,
- общее количество вопросов. Чем выше итоговая оценка, тем в среднем модель обеспечивает более качественный вывод.
4. Исследовательский эксперимент
Исследовательский эксперимент проводился на компьютере с видеокартой Nvidia Geforce GTX 1650 Super, процессором Amd Ryzen 3 3100 и 16 гигабайтами оперативной памяти.
В качестве тестируемой модели была выбрана модель Qwen3.5-4b. Данная модель имеет современную архитектуру и рассчитана для запуска на низкопроизводительном, по меркам больших языковых моделей, железе. Также низкое количество параметров позволит более явно показать влияние агрессивного квантования на результат вывода. Модель тестировалась с контекстным окном 8192 токена.
Результаты Q8_0
Этот уровень квантования показал себя отличным образом, ответив на большинство вопросов, но уступил более низкому квантованию Q5_K_M, что делает нецелесообразным использование этого квантования. Данная модель провалилась в бесконечный цикл размышления при ответе на литературные вопросы, потратив полностью контекстное окно и не выведя ответ.
Результаты Q5_K_M
Данный уровень квантования показал самый наилучший результат. Ответы модели наиболее верные, осмысленные и отсутствует явление галлюцинации. Данная модель провалилась в бесконечный цикл размышления при ответе на литературные вопросы, потратив полностью контекстное окно и не выведя ответ.
Результаты Q4_K_S
Уровень квантования Q4_K_S показал себя намного лучше, чем низкие уровни, выдавая более осмысленные и верные ответы. Единственный раз, когда данная модель не справилась это ответы, на литературные вопросы, потратив все контекстное окно на размышления.
Результаты IQ4_NL
Этот уровень квантования показал себя лучше, чем более низкие уровни. Ключевым недостатком является принудительное ограничение контекстного окна в 2048 токенов, из-за чего модель упирается в этот лимит и не может продолжить свою работу.
Результаты IQ3_XS
Данный уровень квантования показал самые наихудшие результаты вывода ответа. В основном проявляются галлюцинации модели, заставляющие проваливаться в бесконечный цикл. Также чаще модель не следует инструкциям поставленные оператором.
Результаты Q2_K
Уровень квантования Q2_K показал плохие результаты в ответах на тестовые вопросы. Этот уровень часто подвержен галлюцинациям, либо неправильным ответам. Использование данного уровня на постоянной основе не представляется возможным.
Таблица 1.
Итоговые результаты эксперимента
|
|
Ответы на географические вопросы |
Ответы на исторические вопросы |
Ответы на литературные вопросы |
Ответы на математические вопросы |
Ответы на вопросы по химии |
Ответы на вопросы по программированию |
Итоговая оценка |
|
Q8_0 |
25/40 |
49/50 |
0/40* |
30/30 |
27/40 |
20/20 |
0.69 |
|
Q5_K_M |
29/40 |
49/50 |
0/40* |
30/30 |
39/40 |
20/20 |
0.76 |
|
Q4_K_S |
24/40 |
49/50 |
0/40* |
30/30 |
40/40 |
20/20 |
0.74 |
|
IQ4_NL |
19/40 |
48/50 |
0/40* |
0/30* |
40/40 |
1/20 |
0.49 |
|
IQ3_XS |
0/40** |
4/50 |
17/40 |
13/30 |
6/40 |
8/20 |
0.22 |
|
Q2_K |
0/40** |
28/50 |
1/40 |
2/30 |
37/40 |
9/20 |
0.35 |
** Отсутствие ответов моделей на вопросы вызваны возникшими галлюцинациями.
5. Вывод
В ходе исследования было экспериментально оценено влияние квантования на точность вывода больших языковых моделей на примере Qwen3.5-4b.
По результатам эксперимента была определена абсолютная непригодность агрессивного квантования (IQ3_XS и Q2_K) из-за деградации качества модели. Для этих уровней характерны галлюцинации, потеря фактических знаний.
Также уровни квантования на основе гибридного сжатия могут показывать результат лучше, чем уровни квантования с более “дорогим” сжатием. Это делает такие модели (Q5_K_M и Q4_K_S) наилучшими кандидатами для локального развертывания.


