Saturn: ИИ ошибается в 57% финансовых советов — тест 18 моделей

· ·

PrimeCoder · 2026 · формат: news

Что произошло, почему это важно и что взять в работу.

Автоматизация финансов, налогов и отчётности на LLM без человеческой проверки — прямой денежный риск для SMB, поэтому ИИ пока годится только как черновик-ассистент.

Связанные услуги: каталог, AI Boost Team, стать клиентом.

Saturn: ИИ ошибается в 57% финансовых советов — тест 18 моделей — визуал 1
Редакционный кадр к материалу «Saturn: ИИ ошибается в 57% финансовых советов — тест 18 моделей»
Saturn: ИИ ошибается в 57% финансовых советов — тест 18 моделей — визуал 2
Редакционный кадр к материалу «Saturn: ИИ ошибается в 57% финансовых советов — тест 18 моделей»
Saturn: ИИ ошибается в 57% финансовых советов — тест 18 моделей — визуал 3
Редакционный кадр к материалу «Saturn: ИИ ошибается в 57% финансовых советов — тест 18 моделей»

ИИ в финансах сейчас работает как стажёр без доступа к документам и с очень уверенным голосом. Тест Saturn на 18 популярных моделях показал: в среднем 57% ответов на финансовые вопросы содержат ошибку. На сложных задачах доля ошибок вырастает до 88%.

За этими процентами стоит конкретный счёт. В одном кейсе неверный совет Claude по налогам потенциально мог стоить пользователю 17 500 фунтов. Неточность формулировки здесь измеряется в деньгах: человек потерял бы сумму, которую не отдал бы, если бы задал тот же вопрос бухгалтеру.

Для малого бизнеса вывод неприятный и простой. ИИ сегодня годится на роль черновика-ассистента, а не решателя. Всё, что касается налогов, отчётности и платежей, проверяет человек с именем и ответственностью. Иначе вы автоматизируете не работу, а риск.

Что именно проверяли

Saturn прогнала 18 моделей по финансовым вопросам. В списке тестируемых ChatGPT, Claude, Gemini, Copilot и Grok. Это не лабораторные экземпляры, а те самые ассистенты, которые уже встроены в браузеры, офисные пакеты и сервисы для бизнеса. Их открывает ваш менеджер в соседней вкладке, когда не хочет идти к главбуху.

Saturn проверила 18 популярных моделей на финансовых вопросах. В среднем ChatGPT, Claude, Gemini, Copilot и Grok ошибались в 57% ответов, а на сложных задачах — уже в 88%.

Второй результат теста касается цены ошибки. Отдельно описан случай, где неверный налоговый совет Claude потенциально мог обойтись пользователю в 17 500 фунтов.

В одном случае неверный совет Claude о налогах потенциально мог стоить пользователю 17 500 фунтов

Обратите внимание на конструкцию результатов. Средний уровень ошибок и уровень ошибок на сложных задачах отличаются в полтора раза. Значит, вопрос не в том, какая модель «умнее». Вопрос в том, какую задачу вы ей отдаёте.

Таблица риска: где ошибка стоит денег

Что проверялиРезультатЧто это значит для SMB
Финансовые вопросы, 18 моделей, средний срез 57% ответов с ошибкой Каждый второй ответ требует проверки. Читать «по диагонали» нельзя
Сложные задачи 88% ошибок Расчёт с несколькими условиями модель проваливает почти всегда
Отдельный кейс: налоговый совет Claude потенциальный ущерб 17 500 фунтов Цена одной ошибки выражается в живых деньгах

Читать таблицу стоит как карту риска, а не как приговор всем моделям сразу. Средние 57% мало говорят о вашей конкретной задаче, потому что ошибки распределены неровно. На простом вопросе модель может ответить верно десять раз подряд, а на расчёте с тремя условиями ошибиться десять раз из десяти. Средние цифры успокаивают сильнее, чем следует.

Как рынок дошёл до «ИИ-бухгалтера»

Идея переложить финансы на алгоритм не новая. Сначала были системы на правилах: если статья расходов такая, проводка такая. Они работали предсказуемо и ломались на первом же отклонении от шаблона. Потом появились языковые модели, которые отвечают на вопросы связным текстом. Здесь и произошла подмена: раз модель уверенно рассуждает про НДС, значит, она понимает НДС.

Понимания там нет. Есть статистика по текстам, на которых её учили. Налоговое право состоит из ставок, лимитов, сроков и режимов, привязанных к региону, отрасли, организационной форме и текущей редакции закона. Модель видит усреднённую картину из миллионов источников, включая форумы, устаревшие разборы и чужие ситуации, к вашему случаю не относящиеся.

Дальше подключился маркетинг. Ассистента встроили в интерфейс, дали красивое имя, добавили слово «интеллект», и предприниматель получил ощущение, что нанял дешёвого специалиста. На деле он получил генератор правдоподобных абзацев. Для черновика это отличный инструмент. Для решения — нет.

Почему модель ошибается именно в деньгах

Механика простая. Модель не считает налог, она предсказывает, какие слова логично поставить следующими. Предсказание не отделяет факт от похожего на факт. Поэтому ошибка получается гладкой: она не выглядит ошибкой, у неё нормальный тон и уверенные формулировки.

Дальше три системных пробоя, которые бьют по финансам особенно больно.

  • Модель не знает вашу первичку. Ни договоров, ни выписок, ни структуры сделок. Она отвечает на общем уровне, а вы принимаете это за персональный совет.
  • Вы подаёте контекст неполно, а она не переспрашивает. Человек-специалист в такой ситуации задаёт пять уточняющих вопросов. Ассистент отвечает сразу, потому что его задача — выдать текст, а не разобраться.
  • Правила меняются, а уверенность остаётся. Там, где бухгалтер сверяется с текущей редакцией, модель воспроизводит то, что чаще встречала в текстах.

Сложите три пункта, и получите ровно то, что показал тест: на многошаговых задачах ошибка почти неизбежна.

Где ассистент реально экономит время

Отказываться от моделей не нужно. Нужно правильно поставить им рамку. Вот задачи, где польза есть, а риск минимален, если рядом остаётся человек.