Перейти к содержимому

Какую модель выбрать

Ассистент работает с любой моделью, которую отдаёт выбранный провайдер, — выбор за вами. Чтобы он был осознанным, мы прогнали популярные модели сами.

Замеров два, потому что нагрузки две и ведут себя модели в них по-разному:

  • вопрос-ответ — короткий вопрос по продукту, ответ за одно-два обращения к документации. Двенадцать типовых вопросов, август 2026;
  • сборка печатной формы целиком — длинная беседа, в которой ассистент читает документацию и состав конфигурации, смотрит в открытую форму, пишет запросы и алгоритмы. Счёт на оплату от пустого макета до готовой команды печати, сентябрь 2026.

Первый замер отвечает на вопрос «какая модель понятнее объясняет», второй — «с какой моделью работа доходит до конца». Модели и цены у провайдеров меняются быстро, поэтому смотрите на порядок величин и на принципы выбора, а не на конкретные цифры.

Один и тот же набор из двенадцати вопросов, какие обычно задаёт пользователь PrintWizard: с чего начать первую печатную форму, как вывести QR-код и сумму прописью, как настроить формат числа и перенос строки в ячейке, как напечатать пачку документов, как работать с наборами данных и соединениями, что нужно для печати в Word. Отдельный вопрос — о возможности, которой в PrintWizard нет: он проверяет, признает ли ассистент отсутствие функции вместо того, чтобы придумать несуществующие настройки.

Каждый ответ оценивали по трём признакам: получил ли пользователь ответ вообще, опирается ли ответ на документацию продукта и попадает ли он в суть вопроса.

Все модели прогонялись через одного провайдера — российский агрегатор RouterAI, чтобы условия были одинаковыми. Дополнительно одну модель прогнали ещё и напрямую у поставщика: что дал этот замер — в разделе Провайдеры.

МодельОтвечаетВремя ответаРасход на вопросСтоимость вопроса
deepseek/deepseek-v4-flash-0731на все 12~36 с~19 тыс. токенов~0,17 ₽
openai/gpt-5.6-lunaна все 12~31 с~12 тыс. токенов~0,15 ₽
qwen/qwen3.7-flashна 11 из 12~41 с~28 тыс. токенов~0,09 ₽
openai/gpt-5.6-luna-proна все 12~39 с~55 тыс. токенов~0,69 ₽

Идентификаторы приведены так, как они записаны в каталоге RouterAI: у агрегаторов имя модели обычно с префиксом поставщика, при прямом подключении префикса нет (gpt-5.6-luna). У DeepSeek проверялся датированный снимок модели — -0731; без суффикса это отдельная строка каталога.

Время и расход — средние по двенадцати вопросам, все четыре замера сделаны через одного провайдера. Стоимость посчитана по тарифам RouterAI на момент проверки: у других провайдеров цифры отличаются, соотношение примерно сохраняется.

Чем модели отличаются по существу:

  • deepseek-v4-flash даёт самые подробные ответы: раскладывает настройки по шагам, оформляет таблицами перечни реквизитов и допустимых значений. Если нужен разбор с деталями — это лучший выбор.
  • gpt-5.6-luna отвечает короче и точнее по формулировке, заметно быстрее остальных и лучше справляется с вопросами, на которые в документации нет прямого ответа: собирает ответ из соседних разделов, а не пересказывает ближайший.
  • qwen3.7-flash отвечает в целом верно, но тратит заметно больше обращений к документации: в среднем четыре с половиной круга поиска против двух-трёх у остальных. На одном вопросе из двенадцати он так и не собрал ответ — перебирал разделы, пока не упёрся в лимит обращений. Отсюда и самый большой расход токенов, и самое долгое ожидание.
  • gpt-5.6-luna-pro на нашем наборе вопросов по содержанию ответов от обычной версии не отличается, но расходует в четыре с половиной раза больше токенов и отвечает дольше. Переплачивать за неё для работы с ассистентом смысла нет.

Одну и ту же печатную форму — счёт на оплату — мы собрали дважды, от пустого макета до команды печати в документе. Сначала на сильной модели deepseek-v4-pro, затем на предустановленной deepseek-v4-flash; оба раза через прямое подключение к DeepSeek.

deepseek-v4-prodeepseek-v4-flash
Вопросов задано2532
Обращений к модели10288
Обращений на один вопрос4,12,8
Работа модели18 мин11 мин
Ожидание инструментов6 мин5 мин
Активное время сборки≈ 1 ч 5 мин≈ 50 мин
Стоимость≈ 26 ₽≈ 8 ₽

Про время стоит пояснить, иначе оно читается неверно. Работа модели — это столько она думала над ответами за всю сборку: 18 и 11 минут. Активное время сборки посчитано по трассировке, без пауз длиннее двух минут: в первом прогоне человек параллельно вёл записи, и календарные два часа к моделям отношения не имеют. Всё остальное внутри активного времени — человек: прочитать ответ, найти поле в дереве, заполнить, проверить печатью.

И оговорка, без которой числа читаются неверно: второй раз форму собирал человек, который уже знал дорогу, и вопросов задал больше (32 против 25, добавились логотип, повтор шапки и QR-код). Часть выигрыша по времени — не заслуга модели.

Честно сравнивается другое — где каждая модель спотыкается. Дешёвую пришлось поправлять девять раз, сильную — два-три, и промахи дешёвой одного рисунка:

  • короткий путь (загрузить готовый макет из конфигурации вместо рисования с нуля) сильная модель предложила сама, дешёвая — только после наводящего вопроса;
  • просьбу «называй поля вместе с их представлениями» дешёвая модель выполнила и забыла через три хода; сильная держала её до конца беседы;
  • привязала поле не к тому набору: сумма скидки попала в шапку, где повторялась бы в каждой строке таблицы;
  • предложила поле, которого в запросе нет. Правда, увидев текст ошибки, разобралась сама и выправилась;
  • пропустила шаг маршрута — про сумму прописью пришлось вспомнить человеку.

И то, что важнее различий: промахи, вызванные пробелами в документации, повторились на обеих моделях слово в слово. Обе угадывали название команды там, где его не было в тексте главы, обе называли имена реквизитов вместо представлений. За то, чего мы не написали, модель не отвечает — и переход на более дорогую этого не лечит.

Вопрос стоит доли рубля, целая печатная форма — десятки: 26 ₽ на сильной модели и 8 ₽ на дешёвой. Ориентир для повседневной работы: десять вопросов в рабочий день — примерно 20–40 рублей в месяц.

К этому добавляется тариф времени суток, если провайдер его различает: у DeepSeek ночью и в выходные действует льготная цена, и та же форма, собранная в пиковые часы, обошлась бы вдвое дороже.

Главное, что определяет счёт, — не длина ответов, а объём прочитанного: платите вы за то, что ассистент читает, а не за то, что пишет. На сборке формы выходных токенов набралось 40 тысяч против 3,7 миллиона входных, и 96 % входных обслужил кэш провайдера. Отсюда следствие, которое обычно удивляет: длинная беседа обходится дёшево, а привычка начинать новую на каждый вопрос — дорого, потому что новой беседе кэшу не за что зацепиться. Как беседа расходует место и что делает сжатие — в главе Ассистент.

Расход зависит и от формулировки: если ассистенту хватает одного обращения к документации, вопрос стоит дешевле, чем когда он перебирает разделы. Чем точнее сформулирован вопрос, тем дешевле и быстрее ответ.

Сначала главное: на таких суммах экономить на модели незачем. Разница между дешёвой и сильной моделью на целой печатной форме — восемнадцать рублей, на отдельном вопросе — копейки. Поэтому выбирайте не по цене, а по тому, сколько ошибок вы готовы поймать сами.

  • Делаете первую форму, не пишете код, сверить ответ вам не с чем — берите сильную модель, например deepseek-v4-pro. Она реже сбивается с маршрута и дольше помнит ваши указания, а это именно те промахи, которые новичок не замечает.
  • Знаете продукт и видите ошибку глазами — предустановленной deepseek-v4-flash достаточно: она быстрее и дешевле, а её промахи — «поле не из того набора», «забыл шаг» — вы поймаете сразу.
  • Нужна скорость и краткость ответов — gpt-5.6-luna.
  • Нужен подробный разбор по шагам — deepseek-v4-flash.
  • Нужна минимальная цена — qwen3.7-flash, с поправкой на то, что на сложном вопросе он может так и не дойти до ответа.

Обратная сторона того же правила: сильная модель не заменяет проверку. Часть промахов не зависит от модели вовсе — они происходят там, где в документации пробел, и повторяются на любой. Если ответ выглядит правдоподобно, но называет незнакомую вам кнопку или поле, проверьте руками — это дешевле, чем переплата за модель.

Модель меняется в настройках ассистента в любой момент и выбирается из каталога вашего провайдера — переключиться и сравнить самому недолго.

Каталог провайдера обычно содержит десятки моделей. На что смотреть:

  • Поддержка вызова инструментов. Ассистент ищет ответы во встроенной документации, а для этого модель должна уметь вызывать инструменты. Модели без такой поддержки будут отвечать «из общих знаний» и чаще ошибаться в том, что касается самого PrintWizard. Те, про которые провайдер прямо сообщил, что инструментов нет, ассистент в список не выводит, — но такие сведения отдаёт не каждый каталог, поэтому проверить всё за вас он не может.
  • Размер контекста. Берите с запасом — от 128 тысяч токенов. Отдельный вопрос укладывается в единицы десятков тысяч: модели уходят подобранные разделы документации, а не вся она целиком. Но за долгую работу в беседе накапливается прочитанное — темы документации, состав объектов конфигурации, снимки открытой формы, — и на сборке печатной формы это уже сотни тысяч токенов за беседу. Ассистент сжимает беседу, когда она перерастает рабочий объём, но запас по контексту всё равно нужен.
  • «Думающие» модели. Модели с режимом рассуждений тратят на ответ больше времени и токенов. Ассистент по возможности отключает этот режим сам, но если выбранная модель существует только в «думающем» варианте, ответы будут дороже.
  • Версии pro и max. На коротких вопросах более дорогая версия той же модели редко отвечает заметно лучше — на нашем наборе gpt-5.6-luna-pro не отличалась от обычной ничем, кроме расхода. А вот на длинной работе разница уже видна: сильная модель дольше держит указания и реже теряет шаг маршрута. Короткие вопросы — не повод переплачивать, сборка формы — повод подумать.

Все перечисленные модели доступны через нескольких провайдеров сразу. Российские агрегаторы (в списке провайдеров они отмечены) работают без VPN и принимают оплату в рублях; прямые подключения к зарубежным сервисам требуют VPN и зарубежной карты.

Мы прогнали один и тот же набор вопросов на модели gpt-5.6-luna двумя путями — напрямую у поставщика и через агрегатор. Результаты полезно знать заранее:

  • Объём запроса одинаковый. Разница составила меньше процента: посредник ничего не добавляет к тому, что уходит модели.
  • Ответы те же. Полнота и формулировки не изменились: агрегатор передаёт запрос модели как есть.
  • Через агрегатор немного дольше. Ответы приходили примерно на треть медленнее — 31 секунда против 23 — на практике это несколько секунд на вопрос.
  • Кэш может срабатывать хуже. Каждый следующий запрос ассистента начинается с того же, что и предыдущий, — инструкции и уже подобранные разделы документации, — а провайдеры тарифицируют такое повторное начало заметно дешевле. Напрямую из кэша обслужилось около 88 % входных токенов, через агрегатор на той же модели — около 57 %. Объём запроса от этого не меняется, а счёт — да. Это один прогон, и на кэш влияет много обстоятельств, но при сравнении провайдеров держите в уме: низкая цена за тысячу токенов может съедаться худшим попаданием в кэш.

Если расход важен, сравните тарифы в каталоге своего провайдера: ассистент показывает баланс и расход токенов после каждого ответа, включая обслуженные из кэша.

Отдельно стоит помнить: у одной модели в каталоге бывает несколько строк — обычная версия и pro, а иногда ещё и датированные снимки вроде -0731. Названия похожи, а расход отличается в разы — сверяйте не только семейство модели, но и точный идентификатор целиком.

  • Ассистент — подключение, ключ API, проверка соединения и настройка провайдера.