Игра вышла в русле более широкого тренда: в один день, 24 августа, вышло сразу несколько игр с одинаковой механикой «найди иголку в огромном стоге» — рядом с этой в тот же день появилась игра про поиск жёсткого диска с биткоинами в мусорном полигоне (отсылка к реальной истории Джеймса Хауэллса), а раньше — игра про поиск одной соломинки среди 5 миллионов. Идея предельно простая и легко объяснимая, и от этого не менее мучительно смешная.
Please open Telegram to view this post
VIEW IN TELEGRAM
Узор разрабатывался через «состязательный цикл»: генерируешь вариант, показываешь детектору, замеряешь уверенность, корректируешь — пока уверенность модели не рухнет. В июне Векерт лично протестировал рубашку перед реально работающей камерой — успешно. Сам он честно говорит: это не инструмент для уклонения от полиции, а скорее вопрос — насколько системе стоит доверять общественное пространство, если её обманывает кусок ткани.
Please open Telegram to view this post
VIEW IN TELEGRAM
Экономика стала возможна благодаря снижению цены Luna на 80% в конце июля. Когда задача требует более серьёзного рассуждения, агент сам временно переключает на мощную модель (Sol), а потом возвращается обратно. Replit нативно интегрировала все варианты GPT-5.6 — без своих API-ключей и отдельного биллинга.
Please open Telegram to view this post
VIEW IN TELEGRAM
Аргументация на конкретных прецедентах: после покупки Twitter компания нарушила условия контракта с OpenAI, а под присягой сам Маск признал, что xAI дистиллировала данные OpenAI для обучения своих моделей. OpenAI также упоминает растущую ответственность в связи с релизом модели Astra — хочет быть уверена, что топовые модели используются строго по правилам.
Показательный эпизод консолидации империи Маска — SpaceX, Twitter/X, xAI, теперь и Cursor — и того, как репутация человека становится технической причиной разрыва партнёрства.
Please open Telegram to view this post
VIEW IN TELEGRAM
Результаты впечатляют: в QuEra агент за одну ночь довёл восстановление «замка» лазера квантового компьютера с 58% до 99.3% успеха, ускорив процесс с 150 до 6 секунд. В CMU эксперимент по дозозависимым кривым стал в 3 раза быстрее, а интеграция оборудования заняла 8 часов вместо недель. При этом Anthropic честно отмечает: Claude всё ещё путает физические причины ошибок с программными багами и часто перестраховывается, ожидая подтверждения человека.
Please open Telegram to view this post
VIEW IN TELEGRAM
📂 Подборка каналов по AI, IT & HR Tech
Каналы для тех, кто работает в IT и хочет держать руку на пульсе без мониторинга сотни источников ✔️
Что внутри:
Посмотреть и подписаться можно здесь ⬇️ https://t.me/addlist/nXNk7Y2TLoE0Y2Jk
📩 Записаться в папку
Каналы для тех, кто работает в IT и хочет держать руку на пульсе без мониторинга сотни источников ✔️
Что внутри:
AI-блок: новости, нейросети, ИИ-инструменты и кейсы внедрения, стартапы, датасеты
Dev-блок: Java, Python, JS (Frontend/Backend), Mobile, QA, промышленная автоматизация (IIoT)
Отдельно: Cybersecurity, SciPop, IT-вакансии, биржа фриланса, бизнес-новости, Agile/PMP-менеджмент
Бонус: IT-мемы и юмор
Посмотреть и подписаться можно здесь ⬇️ https://t.me/addlist/nXNk7Y2TLoE0Y2Jk
📩 Записаться в папку
👍1
Показательный пример — игра Ним с известной оптимальной стратегией: модель находит её на английском, но часто теряет на арабском или иврите, если сама спонтанно не переключается на латиницу во внутренних рассуждениях. Проблема не в знаниях, а именно в применении навыка рассуждения через конкретный языковой канал.
Please open Telegram to view this post
VIEW IN TELEGRAM
Первый инструмент — открытый Chunk CLI: вытаскивает из истории код-ревью самых ценных ревьюеров и их повторяющиеся комментарии, превращает в чеклисты-промпты для агента, который ревьюит код локально до открытия PR — вместо гонки фидбэка туда-обратно копипастой.
Главная мысль: роль человека смещается от чтения каждой строки диффа к управлению риском — машина сама отделяет структурно неинтересное от реально рискованного. И совет по промптингу: цикл коротких проходов («проверь security», «проверь off-by-one») работает лучше одного большого плана — модель хуже приоритизирует внутри раздутого контекста.
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 Держим AI-Новости ПОД РУКОЙ — собрали в одну Telegram-папку каналы про нейросети, новые инструменты и полезные обновления.
Добавляем всю [подборку] одним нажатием и не ищем каждый канал вручную.
📩 Запись в папку
Внутри - IT, AI & HR Tech: свежие сервисы, рабочие фишки и материалы, которые помогают быстрее разбираться в новых технологиях и найти работу по специальности.
Добавляем всю [подборку] одним нажатием и не ищем каждый канал вручную.
📩 Запись в папку
❤1👍1🔥1
Результаты впечатляющие: с JIT-Agent DeepSeek-V4-Flash обходит GPT-5.6 на бенчмарках (+9.1 и +4.3 балла), а уже сильная GLM-5.2 получает прирост до +20.2. Сгенерированные харнессы конкурентоспособны с такими зрелыми рантаймами, как Claude Code.
Please open Telegram to view this post
VIEW IN TELEGRAM
Харнесс состоит из трёх частей: инструменты (файлы, код в песочнице, интернет, computer use, плюс MCP для подключения внешних сервисов), память (файлы-инструкции вроде agents.md, сжатие разросшегося контекста, поиск нужных кусков вместо загрузки всей кодовой базы) и агентный цикл — модель планирует шаг, харнесс выполняет, модель смотрит на результат и повторяет, а современные харнессы постоянно верифицируют себя по ходу через тесты и скриншоты.
Практический вывод: вопрос «хорош ли ИИ в кодинге» на самом деле состоит из двух — какая модель и какой харнесс вокруг неё.
Please open Telegram to view this post
VIEW IN TELEGRAM
Требования: ноутбук с 16+ ГБ памяти, ставится за час через DuckDB + LM Studio + квантованная модель. На M5 MacBook Air — 5-7 токенов/сек, на пятилетнем M1 Pro тоже рабочий результат при чуть более просевшей точности.
Продолжение темы дешёвых открытых моделей, которую мы разбирали через Qwen на MacBook и Raspberry Pi — только здесь уже конкретный измеримый экономический кейс.
Please open Telegram to view this post
VIEW IN TELEGRAM
Техническая причина — в природе контекстных окон: модель теряет середину или даже начало по мере заполнения контекста, но продолжает выдавать уверенный гладкий текст. Отсюда три типа сбоев: пропуск важного, галлюцинация и неверная интерпретация смутных инструкций.
Главный совет: если проверка не даёт конкретного действенного результата — это не проверка. Не просите эксперта прочитать 2500 слов и сказать «верно ли», а дайте список извлечённых правил и попросите подтвердить каждое отдельно.
Please open Telegram to view this post
VIEW IN TELEGRAM
😭1