Новый дипсик - мои замеры:
01.08.2026, 09:02 · ⏱ 2 мин
Новый дипсик - мои замеры:
Модель обновили тайком. Название в настройках то же самое, но работает она уже по-другому. Узнаёшь об этом только из новостей или когда начинают сыпаться ошибки.
Модель начала «рассуждать» про себя, и это стоит денег. Теперь перед каждым ответом она прокручивает внутренние размышления, которые вы не видите. По нашим замерам, из 30 тысяч сгенерированных символов почти всё ушло на эти скрытые рассуждения, а сам видимый ответ занял меньше процента. Счёт за генерацию текста за сутки вырос в два раза.
Ответ приходит медленно. Раньше мы ждали ответ до 120 секунд, теперь — до трёх с лишним минут. Часть запросов просто обрывается, не дождавшись конца, но списываются и за оборванные попытки.
При этом модель реально стала лучше. Мы взяли 50 настоящих задач из лога, прогнали через старую и новую версию, отдали шести живым людям на оценку. По четырём критериям из шести новая победила.
Меньше врёт в деньгах. Старая модель могла написать «Фарфоровые виниры 19 990 ₽», хотя это цена одной единицы, а полная работа стоит около 200 тысяч. Новая берёт проверяемую цифру с сайта.
Автоматическая проверка текстов стала точнее. Старая модель нашла 13 расхождений с сайтом, из них четыре оказались ложной тревогой. Новая нашла четыре расхождения, и все подтвердились при ручной проверке. Не стала хуже видеть — перестала придираться к тому, чего нет.
Рассуждения можно отключить. Это ускоряет работу на 13% и экономит 12% бюджета. Мы проверили на всех типах задач и выключать везде не стали: где модель просто достаёт информацию — выключили, где принимает решения, от которых зависят деньги клиента, — оставили думать.
Выгода оказалась скромной. Думали сэкономить сильно, но самая частая и дорогая задача — как раз из тех, где отключать рассуждения нельзя. Реальная экономия вышла около 6% от прежних расходов, а не те 88%, на которые можно было бы надеяться.
Итог: модель стала честнее и точнее. Но «эффективнее» в переводе с языка пресс-релизов означает «тратит больше ваших денег на свои размышления». Оно того стоит не везде, и экономить придётся вручную, задачу за задачей.
✍️ Вишневецкий в рупоре
Подпишись: TG / mekct
+Бот автоподписи+
Модель обновили тайком. Название в настройках то же самое, но работает она уже по-другому. Узнаёшь об этом только из новостей или когда начинают сыпаться ошибки.
Модель начала «рассуждать» про себя, и это стоит денег. Теперь перед каждым ответом она прокручивает внутренние размышления, которые вы не видите. По нашим замерам, из 30 тысяч сгенерированных символов почти всё ушло на эти скрытые рассуждения, а сам видимый ответ занял меньше процента. Счёт за генерацию текста за сутки вырос в два раза.
Ответ приходит медленно. Раньше мы ждали ответ до 120 секунд, теперь — до трёх с лишним минут. Часть запросов просто обрывается, не дождавшись конца, но списываются и за оборванные попытки.
При этом модель реально стала лучше. Мы взяли 50 настоящих задач из лога, прогнали через старую и новую версию, отдали шести живым людям на оценку. По четырём критериям из шести новая победила.
Меньше врёт в деньгах. Старая модель могла написать «Фарфоровые виниры 19 990 ₽», хотя это цена одной единицы, а полная работа стоит около 200 тысяч. Новая берёт проверяемую цифру с сайта.
Автоматическая проверка текстов стала точнее. Старая модель нашла 13 расхождений с сайтом, из них четыре оказались ложной тревогой. Новая нашла четыре расхождения, и все подтвердились при ручной проверке. Не стала хуже видеть — перестала придираться к тому, чего нет.
Рассуждения можно отключить. Это ускоряет работу на 13% и экономит 12% бюджета. Мы проверили на всех типах задач и выключать везде не стали: где модель просто достаёт информацию — выключили, где принимает решения, от которых зависят деньги клиента, — оставили думать.
Выгода оказалась скромной. Думали сэкономить сильно, но самая частая и дорогая задача — как раз из тех, где отключать рассуждения нельзя. Реальная экономия вышла около 6% от прежних расходов, а не те 88%, на которые можно было бы надеяться.
Итог: модель стала честнее и точнее. Но «эффективнее» в переводе с языка пресс-релизов означает «тратит больше ваших денег на свои размышления». Оно того стоит не везде, и экономить придётся вручную, задачу за задачей.
✍️ Вишневецкий в рупоре
Подпишись: TG / mekct
+Бот автоподписи+
Оригинал в Telegram: @vrupore
📚 Читать дальше
📄
Прозрачная воронка = уверенные решения.
Я делился, что за 0 рублей 0 копеек силами промпта настроил и запустил рассылку
📄
Умного поста вам в ленту про байесовские методы.
📄
Госдума VIII созыва завершила свою работу — за пять лет депутаты приняли 2 890 ф
📄
Оказывается охереть как много токенов жрет Claude в режиме Research. Просто как
📄
mekct.ru — сервис публикации ответов ИИ в веб-страницы
