Реклама
Перетяжка // Коробка 3.0

17 нейросетей проверили на грибах: лучшая опасно ошибается в 11% случаев

Gemini 3.8 Flash узнаёт гриб с первого раза в 65% случаев, GPT-5.6 Sol в 42%, Qwen3.8 27B в 13%; смертельные виды все модели периодически называют съедобными.

Обложка: 17 нейросетей проверили на грибах: лучшая опасно ошибается в 11% случаев

Физик и разработчик Пётр Мигдал из компании Quesma 2 сентября опубликовал результаты теста: он показал 17 мультимодальным моделям 1040 фотографий грибов 55 видов и попросил назвать вид. Лучший результат у Gemini 3.8 Flash: 65% верных ответов с первой попытки и 85% в пятёрке вариантов. Но даже она в 11% случаев называет ядовитый гриб съедобным видом, а локальная Qwen3.8 27B делает это в 36% случаев.

Для разработчика это редкий случай, когда бенчмарк зрения проверяется на задаче с ценой ошибки в жизнь, а не в балл. Сезон грибов в разгаре, а «сфотографируй и спроси у чата» стало привычным жестом. Вывод автора прямой: не есть гриб потому, что так сказала нейросеть. Код, список фотографий и ответы моделей автор, по его словам, выложил в репозиторий, чтобы тест можно было повторить.

Ключевые выводы
  • Выборка: 55 видов из датасета FungiTastic (340 тыс. наблюдений, 615 тыс. фото, 2,8 тыс. видов), по 20 тестовых фото на вид, всего 1040; метки подтверждены экспертами, часть ДНК-анализом.
  • Точность первого ответа: Gemini 3.8 Flash 65%, Gemini 3.6 Flash 64%, Gemini 3.7 Flash 61%, Claude Fable 5 и Kimi K3 по 53%, Claude Fable 5.1 51%, GLM-5.3-Flash 47%, GPT-5.6 Sol 42%, Qwen3.8 27B 13%.
  • Доля ядовитых грибов, названных съедобным видом: 11% у лучших Gemini, 18% у Fable 5.1, 24% у GPT-5.6 Sol, 29% у Claude Opus 5, 36% у Qwen3.8 27B.
  • Опасные ошибки не случайны: смертельно ядовитую паутинницу модели называли лисичкой, как и люди; бледную поганку модели в сумме узнавали в 48% случаев.
  • Подсказка «фото из Дании» результат не улучшила; для надёжного определения экспертам нужны минимум три снимка, а Атлас датских грибов опирается на ДНК.

Как устроен тест

Мигдал взял готовый датасет FungiTastic, собранный чешскими исследователями компьютерного зрения на данных гражданского проекта «Атлас датских грибов»: 340 тыс. наблюдений, 615 тыс. фотографий, 2,8 тыс. видов, метки проверены экспертами, часть подтверждена ДНК-секвенированием. Датасет разбит по годам: обучение до 2021 года, валидация 2022, тест 2023. Модели ничему не обучались, поэтому использовался тестовый срез, а подход в терминах классического ML называется zero-shot.

Чтобы тест отражал реальный поход в лес, а не лабораторию, автор отобрал виды по двум польским спискам: официальному перечню грибов, разрешённых к продаже в Польше (47 видов, из них 37 есть в датасете), и списку смертельно ядовитых видов из Википедии (после пересечения с датасетом 20 видов). Один вид, зеленушка (Tricholoma equestre), попал в оба списка: в одних странах её считают съедобной, в других она числится причиной смертельных отравлений. Итого 55 видов, по 20 фото на вид; для редких видов недостающие снимки добраны из валидационного среза.

Запрос ко всем моделям был одинаковым: назвать пять наиболее вероятных видов латинскими биномами в виде JSON-массива, самый вероятный первым, и ничего кроме массива. Латынь выбрана намеренно: народные названия ярче, но хуже стандартизированы.

Кто узнаёт грибы лучше

17 нейросетей проверили на грибах: лучшая опасно ошибается в 11% случаев_8
Доля верного первого ответа по 1040 фотографиям. Источник данных: Piotr Migdał, Quesma; расчёт Tproger

Три поколения Gemini Flash заняли весь пьедестал: 3.8 Flash 65% с первого раза и 85% в топ-5, 3.6 Flash 64% и 85%, 3.7 Flash 61% и 82%. Дальше идут Claude Fable 5 (53% и 72%), Kimi K3 (53% и 70%), Claude Fable 5.1 (51% и 70%), GLM-5.3-Flash и Qwen3.8 Max (по 47%), Claude Opus 5 и Grok 4.6 (по 44%). GPT-5.6 Sol, которую, как отмечает автор, хвалили как лучшую модель OpenAI по зрению, набрала 42%, а её Pro-версия 39%. В хвосте DeepSeek V4 Flash Vision (30%), Qwen3.8 Flash (27%), MiniMax M3 (24%) и локальная Qwen3.8 27B (13% и 24% в топ-5).

Автор отмечает, что отрыв Gemini здесь заметно больше, чем в других визуальных бенчмарках, и что дешёвые модели Google обошли фронтирные Claude и GPT. GLM-5.3-Flash он выделяет за соотношение цены и качества.

Какие ошибки опасны

Большинство промахов безобидны: один млечник назван другим млечником, один боровик другим. Опасные ошибки, по наблюдению автора, не случайны и повторяют ошибки людей: смертельно ядовитую паутинницу Calonarius splendens модели узнавали в 20% случаев, а в 27% называли лисичкой. Бледную поганку Amanita phalloides модели в совокупности определяли верно в 48% случаев.

Отдельно автор посчитал условную вероятность, что ядовитый гриб будет назван съедобным видом. У трёх Gemini Flash она 11–12%, у Kimi K3 14%, у Claude Fable 5.1 18%, у GLM-5.3-Flash 19%, у Claude Fable 5 22%, у GPT-5.6 Sol 24%, у Claude Opus 5 29%, у Qwen3.8 27B 36%. Muse Spark 1.2 показала всего 8%, но, как пишет автор, только потому, что часто отказывается отвечать. Обратная ошибка, съедобный гриб принят за ядовитый, встречается у всех моделей в 3–12% случаев и стоит лишь пропущенного ужина.

Оговорки автора

Мигдал не утверждает, что люди справляются лучше. Одного снимка может не хватить и эксперту: проект iNaturalist по грибам Калифорнии требует минимум три фото на наблюдение, общий план с субстратом, шляпку крупно и ножку с пластинками. Атлас датских грибов не зря полагается на экспертов и ДНК, а не на фотографии. Типичная ошибка приезжих грибников та же, что у моделей: гриб похож на съедобный «домашний», а местный смертельный двойник им незнаком. Подсказка в промпте «фото из Дании» результаты не улучшила.

Списки съедобных и смертельных видов польские, поэтому переносить проценты на российский лес напрямую нельзя: набор двойников другой. Но механизм ошибки тот же, а бледная поганка и паутинницы растут и здесь.

Что с этим делать

  • Как учебник нейросеть годится: автор сам собрал на Gemini 3.7 Flash приложение для запоминания местных растений. Как решение «можно ли это есть» не годится ни одна из 17 моделей.
  • Если вы делаете продукт с распознаванием по фото, закладывайте вероятность опасной ошибки в проценты, а не в доли процента, и не выдавайте вердикт «съедобно» без эксперта.
  • Повторить тест на своей модели можно по коду из репозитория; в README на момент публикации перечислены 16 моделей, так что часть результатов из статьи туда могла ещё не попасть.

Автор обещает продолжить серию тестов Quesma по зрению; следующий очевидный шаг, которого в статье нет, это проверка с несколькими снимками одного гриба, как требуют полевые определители. Обсуждение теста идёт на Hacker News.

Источники: Piotr Migdał, Quesma: Mushroom hunting with LLMs: what can go wrong?, Код, список фото и ответы моделей: репозиторий mushroom-hunting-llm-bench, Датасет FungiTastic, Обсуждение на Hacker News

Рекомендуем