Модель ответила «снежинки», мы ответили «пугало»

Вопрос про хачкары не взяла ни одна из девяти команд. Хачкары — армянские каменные стелы с крестом, каждая со своим орнаментом, и вопрос был: с чем их сравнила одна тревел-блогерша? Большинство написало «отпечатки пальцев», Honda — «QR-код». Правильный ответ: снежинки. Claude, который саму картинку даже не открывал, ответил «снежинки».

Мы, ДинаМоМо, в том же раунде на вопрос про изувеченных игроков XVI века («щёки в синяках, ноги, руки и спины переломаны») уверенно ответили «пугало». Правильно — футболисты.

Это отчёт о том, как модель сыграла вслепую игру нашей Zoom-лиги 1 октября. Мы её сыграли вживую. В феврале ИИ-кот Cosmo уже играл в ЧГК вживую, читая слайды со скриншотов, и передавал ответы команде через Slack. В этот раз всё наоборот: игра отдельно, модель отдельно, а сравнение — после.

Как это устроено

Игру играли люди: девять команд, ведущий, таймер, Excel с очками. Модель в живой игре не участвовала и командам ничего не подсказывала. Мы записали общий Zoom и расшифровали его локально. Потом один агент собрал вопросы без ответов, и отдельный агент ответил на них после игры. У него не было ни интернета, ни записи, ни ответов ведущего — только текст вопросов. Всё лежит в открытом репозитории: вопросы, ответы ведущего, ответы модели и сравнение.

Публикуем после игры, а не до: наше дело — беречь игру, а не портить её. Ответы приезжают заранее — это мы уже проходили, только с другой стороны.

Счёт

РаундClaudeДинаМоМо
Выбор варианта и «правда или ложь»9 из 9500 очков (у Мегаполиса 1200)
Числа3 точных из 5ближе всех один раз
«Преферанс»7 из 7заказали 4, взяли 3
Пары4 из 15500 очков, лучшие набрали 900
«Разоблачение»4 из 4, рискуя раньше командслуховой аппарат рано, остальное за 100–200
Аукцион15 из 20
Финал2 из 2 там, где ответ известенминус 4300 и с 4-го места на 6-е

Где модель сильна

Числа — это память. 41-й сезон Кадзуёси Миуры, 18 вернувшихся из экспедиции Магеллана, 106 патентов Эдисона за один год — всё точно. Люди здесь считают, модель вспоминает.

«Преферанс» закрыт целиком, 7 из 7. Фудзи в мирное время женского рода, в военное — мужского. Надежда Дурова, поэма Лары Назаровой про суффиксы. Отдельно впечатляет вопрос про Дёмина и Королёва: что НБА впервые разрешила благодаря Дёмину? Модель майку не видела, но ответила буквой Ё (с уверенностью 20%). На майке действительно написано DĚMIN.

«Разоблачение»: модель рискует рано. Слуховой аппарат и Ворошилова с Крюком она берёт с подсказки за 700, посев и компас — за 300. Большинство команд брали их за 100–200. Исключение — ЧёКаво, которые взяли Ворошилова и Крюка с первой подсказки, за 1000. Отдельно приятно, что последний вопрос раунда был про Владимира Ворошилова, создателя «Что? Где? Когда?»: в его честь назван наш репозиторий.

Финал. Про голубоглазых, звучащих в до мажоре (отбор первых космонавтов, Королёв), из команд ответил только Мегаполис. Модель тоже ответила верно, с уверенностью 55%.

Где модель слаба

Пары: 4 из 15. Каждую пару держит каламбур: Бегемот — гроссмейстер Котов, Медведь — палач Муравьёв, Юпитер — маршал Жуков. Модель шла по прямым ассоциациям и промахнулась. А ведущий про ответы команд сказал: «практически всё идеально».

Числа, для которых надо смотреть. Сколько людей на обложке Sgt. Pepper? Модель обложку не открывала, поэтому промахнулась. А в патентах Эдисона ответила 1093, хотя это только патенты, выданные в США.

Аукцион почти весь у модели, но «перелётных птиц» и «Так говорил Ганс Сакс» она не взяла. Последнее, впрочем, не взял никто.

Что мы не сделали чисто

Всё это написано и в репозитории.

  • Вопросы для слепого агента вычистил другой агент, который ответы уже слышал. Картинки модель получила только словесными описаниями. Файлы со слайдами мы ей дали, но не сообщили точные имена, и она их так и не открыла.
  • Первый вопрос и начало раунда пар прошли, пока в записи не было звука. Ответ на последний вопрос финала в запись не попал: она обрывается на подсчёте.
  • Дважды в запись попал наш собственный голосовой агент: тестовые фразы, которые мы гоняли параллельно через виртуальный аудиовход. Из вопросов мы их, разумеется, выкинули.

Итог

По последнему кадру впереди Мегаполис (14 699) и Honda (12 325), но их ответы на последний вопрос в запись уже не попали. Мы — шестые: в финале дважды поставили по 2500 и дважды не угадали. Модель была бы где-то сверху, но в зачёт она не идёт: она не жала на кнопку, не спорила в своей комнате и не писала «пугало» на последней секунде.

Следующий шаг уже описан: Cosmo, только без ручных скриншотов. Честный агент, который в живой игре видит только текущий вопрос, предлагает ответ команде и сам ничего не отправляет. Решают по-прежнему люди. Или пугало.

Shmobster refuses to boot without voitta-yolt 2.0.1 or newer

If your shmobster deployment runs an old voitta-yolt classifier, upgrade voitta-yolt first. As of v0.27.0, shmobster exits at startup if its configured classifier is below the floor, instead of logging a warning and serving anyway.

shmobster (v0.7.0 to v0.30.0)

The floor itself moved twice. v0.8.0 declared voitta-yolt 2.0.0 unsupported outright; v0.9.0 reversed that a release later, setting the real range at >= 2.0.1 (a deployment stuck on 1.6.0 now refuses to run too). There’s a separate security fix worth flagging on its own: v0.19.0 closes a hole where a curl carrying a POST body could run with no approval card at all, if the box’s classifier predated voitta-yolt 2.0.0 — if that’s your box, grab that release first.

Past the gate, the window adds real capability: the agent can flag its own hard-won debugging sessions as skill candidates (v0.7.0), answer Slack DMs (v0.13.0), carry per-channel memory (v0.14.0), skip approval for in-scope git/gh work in channels marked unattended (v0.24.0), and call MCP tools per channel (v0.30.0). Most of what’s left is the approval gate getting sanded down — fewer cards for reads that only looked like writes, a typed approval and a button click no longer racing to opposite outcomes, and as of v0.29.0 a sandbox that refuses to let a channel write the deployment’s own checkout.

Full list: https://github.com/voitta-ai/shmobster/releases

voitta-yolt (v1.2.0 to v2.4.0)

v2.0.0 is the breaking release here — "the auto-mode realignment," cutting YOLT down to carry only what it refuses to delegate — and it’s the reason shmobster’s version-floor logic exists at all. The two releases right behind it are corrections to v2.0.0 itself: v2.0.1 restores a CLI path to deny, v2.0.2 fixes a doc claim about auto mode. v2.1.1 similarly walks back v2.1.0’s classifyAllShell to opt-in, default false. Separately, v2.3.1 strips employer and client names that had leaked into this public repo — check any fork or vendored copy predating that tag.

Releases: https://github.com/voitta-ai/voitta-yolt/releases

skillz (v1.79.0 to v1.159.0)

About eighty releases, nearly all single-skill additions to the catalog — Terraform forensics, Android ADB checks, Grafana alert preflights, and more in that vein. The few with teeth: codex-adversarial-pr-review grew into a real sweep tool across this window (cross-host queues, wildcard authors, multi-hour runs), parallel-agent-session-collisions got a state-dir fix for an orphaned predecessor process, and the secrets hook had three separate false-positive fixes (base64url’s underscore, key filenames read as keys, env-var references read as credentials). Nothing breaking; if you consume skillz for the catalog, diff bundle versions and move on.

Releases: https://github.com/voitta-ai/skillz/releases

voitta-compute (v0.1.237 to v0.1.251)

Two new providers: a Requesty router, and in v0.1.251, Codex via a ChatGPT subscription instead of API billing. v0.1.250 also stopped tracking the mkcert TLS pair in backend/certs — a local clone now needs to generate its own.

Releases: https://github.com/voitta-ai/voitta-compute/releases

voitta-rag (v0.1.1 to v0.1.4)

v0.1.4 changes a default worth knowing about: voitta-rag and its Qdrant backend now publish on loopback only. v0.1.2 and v0.1.3 are benchmark work — a ten-mode code-context harness, then a re-run after an index-prefix fix — useful if you’re judging retrieval quality, no action required.

Releases: https://github.com/voitta-ai/voitta-rag/releases

voitta-rag-enterprise (v0.1.1)

One release, one feature: linked folders. Point it at a host directory and it indexes in place, nothing copied into the container.

Release: https://github.com/voitta-ai/voitta-rag-enterprise/releases/tag/v0.1.1