Saturn: ИИ ошибается в 57% финансовых советов — тест 18 моделей
PrimeCoder · 2026 · формат: news
Что произошло, почему это важно и что взять в работу.
Автоматизация финансов, налогов и отчётности на LLM без человеческой проверки — прямой денежный риск для SMB, поэтому ИИ пока годится только как черновик-ассистент.
Связанные услуги: каталог, AI Boost Team, стать клиентом.
ИИ в финансах сейчас работает как стажёр без доступа к документам и с очень уверенным голосом. Тест Saturn на 18 популярных моделях показал: в среднем 57% ответов на финансовые вопросы содержат ошибку. На сложных задачах доля ошибок вырастает до 88%.
За этими процентами стоит конкретный счёт. В одном кейсе неверный совет Claude по налогам потенциально мог стоить пользователю 17 500 фунтов. Неточность формулировки здесь измеряется в деньгах: человек потерял бы сумму, которую не отдал бы, если бы задал тот же вопрос бухгалтеру.
Для малого бизнеса вывод неприятный и простой. ИИ сегодня годится на роль черновика-ассистента, а не решателя. Всё, что касается налогов, отчётности и платежей, проверяет человек с именем и ответственностью. Иначе вы автоматизируете не работу, а риск.
Что именно проверяли
Saturn прогнала 18 моделей по финансовым вопросам. В списке тестируемых ChatGPT, Claude, Gemini, Copilot и Grok. Это не лабораторные экземпляры, а те самые ассистенты, которые уже встроены в браузеры, офисные пакеты и сервисы для бизнеса. Их открывает ваш менеджер в соседней вкладке, когда не хочет идти к главбуху.
Saturn проверила 18 популярных моделей на финансовых вопросах. В среднем ChatGPT, Claude, Gemini, Copilot и Grok ошибались в 57% ответов, а на сложных задачах — уже в 88%.
Второй результат теста касается цены ошибки. Отдельно описан случай, где неверный налоговый совет Claude потенциально мог обойтись пользователю в 17 500 фунтов.
В одном случае неверный совет Claude о налогах потенциально мог стоить пользователю 17 500 фунтов
Обратите внимание на конструкцию результатов. Средний уровень ошибок и уровень ошибок на сложных задачах отличаются в полтора раза. Значит, вопрос не в том, какая модель «умнее». Вопрос в том, какую задачу вы ей отдаёте.
Таблица риска: где ошибка стоит денег
| Что проверяли | Результат | Что это значит для SMB |
|---|---|---|
| Финансовые вопросы, 18 моделей, средний срез | 57% ответов с ошибкой | Каждый второй ответ требует проверки. Читать «по диагонали» нельзя |
| Сложные задачи | 88% ошибок | Расчёт с несколькими условиями модель проваливает почти всегда |
| Отдельный кейс: налоговый совет Claude | потенциальный ущерб 17 500 фунтов | Цена одной ошибки выражается в живых деньгах |
Читать таблицу стоит как карту риска, а не как приговор всем моделям сразу. Средние 57% мало говорят о вашей конкретной задаче, потому что ошибки распределены неровно. На простом вопросе модель может ответить верно десять раз подряд, а на расчёте с тремя условиями ошибиться десять раз из десяти. Средние цифры успокаивают сильнее, чем следует.
Как рынок дошёл до «ИИ-бухгалтера»
Идея переложить финансы на алгоритм не новая. Сначала были системы на правилах: если статья расходов такая, проводка такая. Они работали предсказуемо и ломались на первом же отклонении от шаблона. Потом появились языковые модели, которые отвечают на вопросы связным текстом. Здесь и произошла подмена: раз модель уверенно рассуждает про НДС, значит, она понимает НДС.
Понимания там нет. Есть статистика по текстам, на которых её учили. Налоговое право состоит из ставок, лимитов, сроков и режимов, привязанных к региону, отрасли, организационной форме и текущей редакции закона. Модель видит усреднённую картину из миллионов источников, включая форумы, устаревшие разборы и чужие ситуации, к вашему случаю не относящиеся.
Дальше подключился маркетинг. Ассистента встроили в интерфейс, дали красивое имя, добавили слово «интеллект», и предприниматель получил ощущение, что нанял дешёвого специалиста. На деле он получил генератор правдоподобных абзацев. Для черновика это отличный инструмент. Для решения — нет.
Почему модель ошибается именно в деньгах
Механика простая. Модель не считает налог, она предсказывает, какие слова логично поставить следующими. Предсказание не отделяет факт от похожего на факт. Поэтому ошибка получается гладкой: она не выглядит ошибкой, у неё нормальный тон и уверенные формулировки.
Дальше три системных пробоя, которые бьют по финансам особенно больно.
- Модель не знает вашу первичку. Ни договоров, ни выписок, ни структуры сделок. Она отвечает на общем уровне, а вы принимаете это за персональный совет.
- Вы подаёте контекст неполно, а она не переспрашивает. Человек-специалист в такой ситуации задаёт пять уточняющих вопросов. Ассистент отвечает сразу, потому что его задача — выдать текст, а не разобраться.
- Правила меняются, а уверенность остаётся. Там, где бухгалтер сверяется с текущей редакцией, модель воспроизводит то, что чаще встречала в текстах.
Сложите три пункта, и получите ровно то, что показал тест: на многошаговых задачах ошибка почти неизбежна.
Где ассистент реально экономит время
Отказываться от моделей не нужно. Нужно правильно поставить им рамку. Вот задачи, где польза есть, а риск минимален, если рядом остаётся человек.
- Черновик письма. Модель соберёт структуру обращения в налоговую или контрагенту, вы поправите факты и суммы.
- Расшифровка терминов. Объяснить, что означает формулировка в акте или договоре. Решать, применима ли она к вам, всё равно человеку.
- Список вопросов специалисту. Десять пунктов для бухгалтера или юриста вместо получаса раздумий. Это готовит встречу, а не заменяет её.
- Группировка выгрузки. Разложить массив строк по категориям, чтобы главбух быстрее прошёл его глазами.
- Внутренние регламенты. Черновик инструкции по процессу, который вы всё равно переписываете под себя.
- Генерация гипотез. «О чём спросить налоговую, если открываем второе юрлицо». Как источник вопросов, не ответов.