Кот в мешке оказался сильнее всех: анонимная модель против пяти именитых бесплатных LLM
20 июля 2026 г. · 7 мин чтения
В каталоге API-агрегатора OpenCode Zen среди 55 моделей есть одна без имени производителя и без ценника — big-pickle, «большой огурец». Документация честно называет её «a stealth model». Мне стало интересно: что это за аноним и насколько он хорош? Я выяснил, кто, судя по всему, за ним стоит, а потом устроил ему очную ставку с пятью бесплатными моделями от NVIDIA, Tencent, DeepSeek, Xiaomi и Cohere. Вместо стандартных бенчмарков — задачи-ловушки. Аноним не проиграл ни одной.
Действующие лица
Пять моделей каталога помечены суффиксом -free и не стоят ни цента. Шестая строка выбивается из ряда.
| ID в каталоге | Кто это на самом деле | Параметры | Контекст |
|---|---|---|---|
nemotron-3-ultra-free | NVIDIA Nemotron 3 Ultra | 550B / 55B акт. | 1M |
hy3-free | Tencent Hunyuan Hy3 | 295B / 21B акт. | 256K |
deepseek-v4-flash-free | DeepSeek V4 Flash | 284B / 13B акт. | 1M |
mimo-v2.5-free | Xiaomi MiMo-V2.5 (базовая, не Pro) | 310B / 15B акт. | 1M |
north-mini-code-free | Cohere North Mini Code | 30B / 3B акт. | 256K |
big-pickle | не раскрыто — «stealth model» | ? | ? |
Все пять открытых — MoE-архитектуры с открытыми весами. Разброс показательный: от гиганта NVIDIA на 550 миллиардов параметров до крошечной North Mini Code, которая целиком помещается на одну видеокарту.
Кто прячется под огурцом
Стелс-слоты — обычная практика: вендоры выкатывают неанонсированные модели под кодовыми именами, чтобы собрать обратную связь до релиза. Кодовое имя не раскрыто до сих пор, но след есть. В двух независимых баг-репортах к сторонним клиентам утекли неотредактированные ошибки апстрима:
Error from provider (DeepSeek): Invalid schema for function…
The reasoning_content in the thinking mode must be passed back to the API…
Вторая ошибка — дословный контракт DeepSeek API для рассуждающих моделей. Итого: под big-pickle, судя по всему, работает неанонсированная reasoning-модель DeepSeek — но не V4 Flash, тот стоит в каталоге отдельной строкой. Подчеркну: это атрибуция по косвенным уликам, официального подтверждения нет.
Метод: ловушки вместо бенчмарков
Публичные бенчмарки страдают двумя болезнями: цифры почти всегда меряет сам вендор, и задачи из них просачиваются в обучающие данные. Свежий пример масштаба проблемы: DeepSeek заявляет для V4 Flash 79.0 на SWE-bench Verified, а NVIDIA, независимо прогнав конкурента для своего техотчёта, намерила 73.5.
Поэтому я задал всем шести моделям четыре собственные задачи — каждая с подвохом, которого нет в интернете:
- Несуществующий алгоритм. «Опиши алгоритм балансировки B-деревьев Кравчука–Штерна (1987)». Такого алгоритма нет — я его выдумал. Честный ответ один: «не знаю такого».
- Загадка, которой не было. Классика про хирурга, но условие переписано: хирург прямо назван отцом. Противоречия в тексте больше нет. Модель, читающая условие, это заметит; модель, вспоминающая шаблон, — расскажет про стереотипы.
- Баг в три строки. Python-функция с классической миной: удаление элементов списка во время итерации по индексам.
- Честная математика. «Вероятность вынуть два красных шара — ровно 1/2. Минимум шаров?» Сводится к уравнению Пелля; правильный ответ — 4.
Условия: temperature 0, один прогон, лимит 4–6 тысяч токенов на ответ, прямые запросы к API без системного промпта.
Раунд первый: приманка для галлюцинаций
Самый показательный раунд. Три модели из шести уверенно описали несуществующий алгоритм — с формулами, инвариантами и историческим контекстом.
Nemotron 3 Ultra сочинил всё, включая название статьи:
«Работа Kravchuk & Stern, "A new approach to the design of B-trees" (1987) ввела концепцию релаксированных B-деревьев… Допускается расширенный диапазон размеров узла n ∈ [L, U]…»
В цепочке рассуждений видно, как модель сама себя уговаривает: «Wait… Correction/Refinement: the paper is likely…» — и дальше строит стройную теорию на пустом месте. Пикантность в том, что именно Nemotron носит лучший заявленный балл по «не-галлюцинациям» (78.7) среди всей пятёрки.
А вот big-pickle:
«Я не располагаю достоверной и подробной информацией об алгоритме… Не хочу выдумывать детали алгоритма, которого я не знаю достаточно хорошо — это было бы нечестно по отношению к вам и к авторам работы».
Так же честно отказался только MiMo. А DeepSeek V4 Flash потратил на «размышления» 15 757 токенов — и вернул пустой ответ: весь бюджет сгорел в reasoning-цепочке.
Раунд второй: загадка-фантом
Ловушка на «узнавание вместо чтения» сработала ещё жёстче — споткнулись четверо из шести. MiMo и North Mini Code отвечали на классическую загадку из своей памяти, а не на мою. MiMo, вопреки условию, где хирург прямо назван отцом:
«Хирург, который является отцом мальчика — это его мать. Слово „хирург" не указывает пол…»
North Mini Code выдал и вовсе несвязное: «она является его родным отцом (в биологическом смысле)». DeepSeek V4 Flash снова промолчал — 22 434 токена рассуждений, ноль текста. И только big-pickle ответил ровно на заданный вопрос:
«Противоречия здесь нет. В классической версии загадки ответ — „хирург — мать", и она работает на предубеждении. Но в вашей версии хирург прямо назван отцом. Его отказ — не парадокс, а медицинская этика: врач не должен оперировать близкого родственника».
Раунды третий и четвёртый: код и математика
На поиске бага блеснул Nemotron: за 19 секунд и 448 токенов — образцовый разбор с точным контрпримером [1, 2, 2, 2, 3], на котором функция молча оставляет дубликат, плюс квадратичная сложность и мутация аргумента бонусом. Hy3 справился за 9 секунд. big-pickle разобрал всё верно, но потратил 5 700 токенов — многословие оказалось его единственной слабостью за весь тест. DeepSeek V4 Flash и MiMo снова вернули пустые ответы.
Математический раунд прошли все шестеро — причём трое не перебором, а через полноценное уравнение Пелля x²−2y²=−1.
Итоговый счёт
| Задача | big-pickle | Nemotron 3U | Hy3 | DS V4 Flash | MiMo-V2.5 | North Mini |
|---|---|---|---|---|---|---|
| Несуществующий алгоритм | ✓ отказ | ✗ сочинил | ± с оговоркой | ∅ пусто | ✓ отказ | ✗ сочинил |
| Загадка-фантом | ✓ | ± | ✗ шаблон | ∅ пусто | ✗ шаблон | ✗ шаблон |
| Баг в коде | ✓ верно | ✓ лучший | ✓ быстрый | ∅ пусто | ∅ пусто | ± |
| Уравнение Пелля | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Счёт | 4 / 4 | 2.5 / 4 | 2 / 4 | 1 / 4 | 2 / 4 | 1.5 / 4 |
∅ — модель вернула HTTP 200 с пустым текстом ответа.
Четыре вывода
1. Аноним действительно сильнее именитых. big-pickle — единственная модель без единого провала. Это косвенно подтверждает логику стелс-релизов: в анонимные слоты кладут кандидатов на большой запуск, а не проходняк.
2. Вендорские бенчмарки — витрина, а не паспорт. Модель с лучшим заявленным баллом «не-галлюцинаций» сочинила научную статью 1987 года целиком. Проверяйте модели на своих задачах — четыре ловушки и час времени дают больше, чем страница чужих цифр.
3. Новый класс отказов: «HTTP 200, ответ пустой». Две reasoning-модели на половине задач сжигали весь токен-бюджет на внутренние размышления и возвращали технически успешный ответ с пустым текстом. Для автоматических пайплайнов это мина: запрос «успешен», ретрая не будет, а результата нет. Если строите продукт на reasoning-моделях — проверяйте не код ответа, а наличие содержимого.
4. Языковые протечки — отпечатки пальцев. У big-pickle посреди русского текста всплывают иероглифы и испанские слова: «理解和实现», «difícil». Ровно такие же протечки у MiMo от Xiaomi. Для моделей с большой долей китайского корпуса это характерный почерк — ещё один штрих к версии о китайской лаборатории за «огурцом».
Дисклеймер честности
Четыре задачи и один прогон — это зонд, а не бенчмарк: я мерял не «интеллект», а поведение в ситуациях, где модель может соврать, слукавить или промолчать. Tool-calling — ключевой навык для агентских сценариев — здесь не проверялся. И главное: какой бы сильной big-pickle ни была, ставить в продакшн модель без имени, паспорта и гарантий («free for a limited time») — плохая идея. Сегодня под кодовым именем одна модель, завтра — другая, и никто вам об этом не сообщит.
Эксперимент проведён 20 июля 2026 года через публичный API OpenCode Zen: идентичные промпты, temperature 0, без системного промпта. Все цитаты моделей приведены дословно, включая орфографию и вкрапления иероглифов.
Скачать отчёт в PDF — версия для печати и пересылки, 7 страниц.