Блог об AI

Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.

Последние записи

Почему модели думают: как работает test-time compute

Почему модели думают: как работает test-time compute

Лилиан Венг объясняет, почему дополнительные вычисления во время инференса работают: от аналогии с Канеманом до scaling laws для времени размышления и budget forcing.

TTPO: LLM учится на самом экзамене без правильных ответов

TTPO: LLM учится на самом экзамене без правильных ответов

Псевдометка большинства неверна в 85% случаев, а модель всё равно растёт на 7 пунктов. Как TTPO превращает ошибки толпы в сигнал для обучения.

Tacet: система типов, которая не даёт бенчмаркам врать

Tacet: система типов, которая не даёт бенчмаркам врать

Tacet, язык программирования с системой типов, автоматически проверяет статистическую валидность сравнений в бенчмарках. На SWE-bench Verified из 8911 утверждений в порядке чтения таблицы не выживает ни одно.

Puro-2B: предобучение LLM с нуля на RTX 5090 за $6 900

Puro-2B: предобучение LLM с нуля на RTX 5090 за $6 900

Предобучение языковой модели перестало быть привилегией дата-центров: Puro-2B обучена на кластере из потребительских RTX 5090, а полный рецепт с данными и чекпоинтами открыт.

Открытые модели обогнали закрытые: разбор графика Vercel

Открытые модели обогнали закрытые: разбор графика Vercel

DeepSeek обогнал Anthropic по доле токенов (25,2% против 24,5%), но получает лишь 2,8% денег против 64,6%. Почему рынок AI раскололся на объём и выручку, и что это значит для бизнеса.

Когнитивная капитуляция: как ИИ отучает нас думать

Когнитивная капитуляция: как ИИ отучает нас думать

Одна и та же технология в одном эксперименте ухудшила экзаменационные результаты тысячи школьников, а в другом дала прирост, эквивалентный полугоду обучения. Разница была не в модели, а в способе использования.

Claude ставит водяные знаки: Anthropic маркирует весь текст

Claude ставит водяные знаки: Anthropic маркирует весь текст

Anthropic встраивает статистические водяные знаки в ответы Claude, чтобы выполнить статью 52 EU AI Act. Разбираем механизм маркировки, её ограничения и последствия для пользователей.

Self-refinement: маленький критик, большой исполнитель

Self-refinement: маленький критик, большой исполнитель

Команда проверила, как размер модели на каждой стадии self-refinement влияет на результат. Критик почти не чувствителен к масштабу, а слабый исполнитель способен ухудшить исходный ответ.

Как LLM может захватить сервер через движок инференса

Как LLM может захватить сервер через движок инференса

CVE-2025-9141 позволял модели выполнить произвольный код на сервере vLLM через обычный tool call. Это не фантастика, а уже задокументированный класс атак.

K-Search: CUDA-экспертиза переехала на Apple Silicon

K-Search: CUDA-экспертиза переехала на Apple Silicon

Исследователи из IBM Research и UC Berkeley научили эволюционный поиск ядер K-Search переносить знания из CUDA на Apple Silicon: attention-ядро достигло 0.97x от скорости нативного MLX, а prefill Mamba SSM ускорился в 20 раз против mlx-lm.