Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
Почему модели думают: как работает test-time compute
Лилиан Венг объясняет, почему дополнительные вычисления во время инференса работают: от аналогии с Канеманом до scaling laws для времени размышления и budget forcing.
TTPO: LLM учится на самом экзамене без правильных ответов
Псевдометка большинства неверна в 85% случаев, а модель всё равно растёт на 7 пунктов. Как TTPO превращает ошибки толпы в сигнал для обучения.
Tacet: система типов, которая не даёт бенчмаркам врать
Tacet, язык программирования с системой типов, автоматически проверяет статистическую валидность сравнений в бенчмарках. На SWE-bench Verified из 8911 утверждений в порядке чтения таблицы не выживает ни одно.
Puro-2B: предобучение LLM с нуля на RTX 5090 за $6 900
Предобучение языковой модели перестало быть привилегией дата-центров: Puro-2B обучена на кластере из потребительских RTX 5090, а полный рецепт с данными и чекпоинтами открыт.
Открытые модели обогнали закрытые: разбор графика Vercel
DeepSeek обогнал Anthropic по доле токенов (25,2% против 24,5%), но получает лишь 2,8% денег против 64,6%. Почему рынок AI раскололся на объём и выручку, и что это значит для бизнеса.
Когнитивная капитуляция: как ИИ отучает нас думать
Одна и та же технология в одном эксперименте ухудшила экзаменационные результаты тысячи школьников, а в другом дала прирост, эквивалентный полугоду обучения. Разница была не в модели, а в способе использования.
Claude ставит водяные знаки: Anthropic маркирует весь текст
Anthropic встраивает статистические водяные знаки в ответы Claude, чтобы выполнить статью 52 EU AI Act. Разбираем механизм маркировки, её ограничения и последствия для пользователей.
Self-refinement: маленький критик, большой исполнитель
Команда проверила, как размер модели на каждой стадии self-refinement влияет на результат. Критик почти не чувствителен к масштабу, а слабый исполнитель способен ухудшить исходный ответ.
Как LLM может захватить сервер через движок инференса
CVE-2025-9141 позволял модели выполнить произвольный код на сервере vLLM через обычный tool call. Это не фантастика, а уже задокументированный класс атак.
K-Search: CUDA-экспертиза переехала на Apple Silicon
Исследователи из IBM Research и UC Berkeley научили эволюционный поиск ядер K-Search переносить знания из CUDA на Apple Silicon: attention-ядро достигло 0.97x от скорости нативного MLX, а prefill Mamba SSM ускорился в 20 раз против mlx-lm.