Forwarded from Daureн
ARCH CAMP: Burabay Marina Club (Yacht Club).
Закрываем летний сезон на берегу озера Щучье!
📅 29–30 августа 2026
Сбор на месте 29 августа в 15:00, выезд в Астану 30 августа в 15:00.
В программе: архитектурная сессия, практические кейсы, нетворкинг, сапборды, купание, кемпинг и съёмка с дрона, трансляция.
💰 Участие — 30 000 ₸
Включены доступ на закрытую территорию, въезд в паркинг на авто, активности, съёмка, ужин с шашлыками, стейками и бургерами без ограничений, завтрак и напитки.
🚐 Участники самостоятельно организуют трансфер и проживание (своя палатка или аренда на месте).
⛺️ Доступно 6 мест трансфера туда-назад и 3 места для проживания с организаторами (писать в личку).
Регистрация: https://forms.gle/3RqbQN4tYQRb6CPj9
Количество мест ограничено!
Закрываем летний сезон на берегу озера Щучье!
📅 29–30 августа 2026
Сбор на месте 29 августа в 15:00, выезд в Астану 30 августа в 15:00.
В программе: архитектурная сессия, практические кейсы, нетворкинг, сапборды, купание, кемпинг и съёмка с дрона, трансляция.
💰 Участие — 30 000 ₸
Включены доступ на закрытую территорию, въезд в паркинг на авто, активности, съёмка, ужин с шашлыками, стейками и бургерами без ограничений, завтрак и напитки.
🚐 Участники самостоятельно организуют трансфер и проживание (своя палатка или аренда на месте).
⛺️ Доступно 6 мест трансфера туда-назад и 3 места для проживания с организаторами (писать в личку).
Регистрация: https://forms.gle/3RqbQN4tYQRb6CPj9
Количество мест ограничено!
1🔥1
Forwarded from Meiirlan Kaiyrbekov
⚡️ Всего 10 дней до Agentic Football Cup в Алматы!
Регистрация на AI-турнир выходит на финишную прямую. Уже 29 августа мы запустим AI-агентов на виртуальное поле 💻⚽️!
Главное о воркшопе:
▸ Доступный старт: Продвинутое программирование не требуется — важна ваша логика и стратегия.
▸ Реальный опыт с ИИ: Вы своими руками настроите агентов AWS и сразу увидите их работу.
▸ Крутые призы: Гаджеты Apple от нашего генерального партнёра BCC Hub! 🍏☁️
Напоминаем, что лимит строго ограничен — всего 32 команды.
Регистрируйтесь соберем команду на месте.
🗓 29 августа · 09:00–17:00
📍 Promenade, Алматы
🎟 Бесплатно
👉 Забрать свой слот на Meetup
Регистрация на AI-турнир выходит на финишную прямую. Уже 29 августа мы запустим AI-агентов на виртуальное поле 💻⚽️!
Главное о воркшопе:
▸ Доступный старт: Продвинутое программирование не требуется — важна ваша логика и стратегия.
▸ Реальный опыт с ИИ: Вы своими руками настроите агентов AWS и сразу увидите их работу.
▸ Крутые призы: Гаджеты Apple от нашего генерального партнёра BCC Hub! 🍏☁️
Напоминаем, что лимит строго ограничен — всего 32 команды.
Регистрируйтесь соберем команду на месте.
🗓 29 августа · 09:00–17:00
📍 Promenade, Алматы
🎟 Бесплатно
👉 Забрать свой слот на Meetup
Современный Процесс разработки ПО поменялся.
Цитата из свежей статьи от Антропик:
Build is no longer the constraint — the human-speed steps around it are.
Human-speed stages keep their length while build collapses to hours.
Может хоть теперь поубавиться количество скептиков, которые до сих пор верят в то, что AI нельзя пускать в разработку, data engineering (да, такие есть)
Цитата из свежей статьи от Антропик:
Build is no longer the constraint — the human-speed steps around it are.
Human-speed stages keep their length while build collapses to hours.
Может хоть теперь поубавиться количество скептиков, которые до сих пор верят в то, что AI нельзя пускать в разработку, data engineering (да, такие есть)
🔥4
Самая недооценённая работа этого года про text-to-SQL
В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf).
Четверо исследователей из UIUC вручную перепроверили эталонные ответы в двух самых цитируемых бенчмарках. РАХМЕТ им большой за это
Результат:
• BIRD Mini-Dev, 498 примеров — ошибки разметки в 52.8% задач. Предыдущая работа находила 36.1%, то есть нашли ещё 102 сломанных примера
• Spider 2.0-Snow — из 121 задачи с опубликованными эталонами проблемными оказались 80. Это 66.1%
Порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки
Речь именно про эталоны. Про те самые правильные ответы, с которыми сравнивают модель
Что конкретно сломано
• Эталон вызывает
• Вопрос про учеников с 1 по 12 класс, эталон берёт колонку
•
• После JOIN и FLATTEN строки размножились,
• Семь вопросов с неоднозначным форматом вывода: оставил кавычки — ответ признан неверным
Последнее особенно показательно. Агент отвечает правильно и получает ноль за форматирование
А дальше самое интересное
Авторы взяли пять топовых агентов с лидерборда BIRD и прогнали их на исправленной выборке из 100 задач
Точность поехала на от −3% до 31% в относительном выражении, рейтинг перетасовался на три позиции.
Агент CHESS стоял четвёртым — поднялся с 62% до 81% и стал первым. OpenSearch-SQL стоял первым — опустился с 71% до 69% и стал третьим
То есть порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки
Две оговорки, без них нечестно
Команда Spider 2.0 обновила формулировки вопросов в июле 2025 и часть неоднозначностей сняла, а аудит делали по более раннему срезу. И 66.1% — это доля среди 121 проверенной задачи из 547, а не по всему датасету
Но вывод не меняется
Когда вам показывают девяносто с чем-то процентов на публичном text-to-SQL бенчмарке, в этой цифре есть вклад ошибок разметки. И ни вы, ни автор цифры не знаете, какой именно
Поэтому единственная осмысленная метрика для вашей компании — внутренний eval на ваших схемах, ваших определениях метрик и реальных вопросах бизнеса. Чужой лидерборд на этот вопрос не отвечает
А вы свои цифры точности на чём меряете?
В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf).
Четверо исследователей из UIUC вручную перепроверили эталонные ответы в двух самых цитируемых бенчмарках. РАХМЕТ им большой за это
Результат:
• BIRD Mini-Dev, 498 примеров — ошибки разметки в 52.8% задач. Предыдущая работа находила 36.1%, то есть нашли ещё 102 сломанных примера
• Spider 2.0-Snow — из 121 задачи с опубликованными эталонами проблемными оказались 80. Это 66.1%
Порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки
Речь именно про эталоны. Про те самые правильные ответы, с которыми сравнивают модель
Что конкретно сломано
• Эталон вызывает
ST_POINT(26.75, 51.5), а Snowflake ждёт порядок «долгота, широта». Координаты перепутаны в самом эталоне• Вопрос про учеников с 1 по 12 класс, эталон берёт колонку
Enrollment (K-12) — а она включает подготовительный. Эталон отвечает не на заданный вопрос•
TO_TIMESTAMP(end_date) даёт начало последнего дня вместо конца. Эталон молча теряет все события после полуночи• После JOIN и FLATTEN строки размножились,
DISTINCT не поставили — эталон считает дубликаты• Семь вопросов с неоднозначным форматом вывода: оставил кавычки — ответ признан неверным
Последнее особенно показательно. Агент отвечает правильно и получает ноль за форматирование
А дальше самое интересное
Авторы взяли пять топовых агентов с лидерборда BIRD и прогнали их на исправленной выборке из 100 задач
Точность поехала на от −3% до 31% в относительном выражении, рейтинг перетасовался на три позиции.
Агент CHESS стоял четвёртым — поднялся с 62% до 81% и стал первым. OpenSearch-SQL стоял первым — опустился с 71% до 69% и стал третьим
То есть порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки
Две оговорки, без них нечестно
Команда Spider 2.0 обновила формулировки вопросов в июле 2025 и часть неоднозначностей сняла, а аудит делали по более раннему срезу. И 66.1% — это доля среди 121 проверенной задачи из 547, а не по всему датасету
Но вывод не меняется
Когда вам показывают девяносто с чем-то процентов на публичном text-to-SQL бенчмарке, в этой цифре есть вклад ошибок разметки. И ни вы, ни автор цифры не знаете, какой именно
Поэтому единственная осмысленная метрика для вашей компании — внутренний eval на ваших схемах, ваших определениях метрик и реальных вопросах бизнеса. Чужой лидерборд на этот вопрос не отвечает
А вы свои цифры точности на чём меряете?
❤2
Datanomika
Самая недооценённая работа этого года про text-to-SQL В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf). Четверо исследователей…
Практический вывод из этого прямой. Публичный лидерборд не отвечает на вопрос, насколько хорошо агент будет работать в вашей компании: он измеряет чужую систему на чужих схемах чужой разметкой.
Содержательный ответ даёт только внутренний eval на ваших определениях метрик, ваших схемах и ваших реальных ошибках.
Содержательный ответ даёт только внутренний eval на ваших определениях метрик, ваших схемах и ваших реальных ошибках.
Datanomika pinned «Самая недооценённая работа этого года про text-to-SQL В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf). Четверо исследователей…»
BI снова хоронят: подключаем LLM к хранилищу и аналитики больше не нужны, деньги тратить на лицензии не нужно.
По крайней мере, так выглядит обещание.
На практике дата-агент может написать корректный SQL, получить верные цифры и всё равно уверенно ответить не на тот бизнес-вопрос.
Он путается в определениях метрик, теряет права пользователя, дорого ходит по кругу и иногда рассуждает хуже, когда ему дают больше времени.
Я разобрал свежие кейсы OpenAI, Anthropic и Hex: что действительно улучшает ответы, какие очевидные подходы уже провалились, из чего складывается реальная стоимость и как за шесть шагов проверить
https://habr.com/ru/articles/1075946/
По крайней мере, так выглядит обещание.
На практике дата-агент может написать корректный SQL, получить верные цифры и всё равно уверенно ответить не на тот бизнес-вопрос.
Он путается в определениях метрик, теряет права пользователя, дорого ходит по кругу и иногда рассуждает хуже, когда ему дают больше времени.
Я разобрал свежие кейсы OpenAI, Anthropic и Hex: что действительно улучшает ответы, какие очевидные подходы уже провалились, из чего складывается реальная стоимость и как за шесть шагов проверить
https://habr.com/ru/articles/1075946/
👌4