Datanomika
2.73K subscribers
395 photos
58 videos
15 files
432 links
Канал Полоротова Александра.

Co-founder Datanomix.pro

Анонсы AI/Data событий, наблюдения из жизни, прикольчики



Обратная связь - @apolorotov
Download Telegram
Forwarded from Daureн
ARCH CAMP: Burabay Marina Club (Yacht Club).
Закрываем летний сезон на берегу озера Щучье!
📅 29–30 августа 2026
Сбор на месте 29 августа в 15:00, выезд в Астану 30 августа в 15:00.
В программе: архитектурная сессия, практические кейсы, нетворкинг, сапборды, купание, кемпинг и съёмка с дрона, трансляция.
💰 Участие — 30 000 ₸
Включены доступ на закрытую территорию, въезд в паркинг на авто, активности, съёмка, ужин с шашлыками, стейками и бургерами без ограничений, завтрак и напитки.
🚐 Участники самостоятельно организуют трансфер и проживание (своя палатка или аренда на месте).
⛺️ Доступно 6 мест трансфера туда-назад и 3 места для проживания с организаторами (писать в личку).
Регистрация: https://forms.gle/3RqbQN4tYQRb6CPj9
Количество мест ограничено!
1🔥1
Forwarded from Meiirlan Kaiyrbekov
⚡️ Всего 10 дней до Agentic Football Cup в Алматы!

Регистрация на AI-турнир выходит на финишную прямую. Уже 29 августа мы запустим AI-агентов на виртуальное поле 💻⚽️!

Главное о воркшопе:
▸ Доступный старт: Продвинутое программирование не требуется — важна ваша логика и стратегия.
▸ Реальный опыт с ИИ: Вы своими руками настроите агентов AWS и сразу увидите их работу.
▸ Крутые призы: Гаджеты Apple от нашего генерального партнёра BCC Hub! 🍏☁️

Напоминаем, что лимит строго ограничен — всего 32 команды.
Регистрируйтесь соберем команду на месте.

🗓 29 августа · 09:00–17:00
📍 Promenade, Алматы
🎟 Бесплатно
👉 Забрать свой слот на Meetup
Современный Процесс разработки ПО поменялся.

Цитата из свежей статьи от Антропик:

Build is no longer the constraint — the human-speed steps around it are.

Human-speed stages keep their length while build collapses to hours.

Может хоть теперь поубавиться количество скептиков, которые до сих пор верят в то, что AI нельзя пускать в разработку, data engineering (да, такие есть)
🔥4
Самая недооценённая работа этого года про text-to-SQL

В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf).

Четверо исследователей из UIUC вручную перепроверили эталонные ответы в двух самых цитируемых бенчмарках. РАХМЕТ им большой за это

Результат:
BIRD Mini-Dev, 498 примеров — ошибки разметки в 52.8% задач. Предыдущая работа находила 36.1%, то есть нашли ещё 102 сломанных примера
Spider 2.0-Snow — из 121 задачи с опубликованными эталонами проблемными оказались 80. Это 66.1%

Порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки

Речь именно про эталоны. Про те самые правильные ответы, с которыми сравнивают модель

Что конкретно сломано

• Эталон вызывает ST_POINT(26.75, 51.5), а Snowflake ждёт порядок «долгота, широта». Координаты перепутаны в самом эталоне

• Вопрос про учеников с 1 по 12 класс, эталон берёт колонку Enrollment (K-12) — а она включает подготовительный. Эталон отвечает не на заданный вопрос

TO_TIMESTAMP(end_date) даёт начало последнего дня вместо конца. Эталон молча теряет все события после полуночи

• После JOIN и FLATTEN строки размножились, DISTINCT не поставили — эталон считает дубликаты

• Семь вопросов с неоднозначным форматом вывода: оставил кавычки — ответ признан неверным

Последнее особенно показательно. Агент отвечает правильно и получает ноль за форматирование

А дальше самое интересное

Авторы взяли пять топовых агентов с лидерборда BIRD и прогнали их на исправленной выборке из 100 задач

Точность поехала на от −3% до 31% в относительном выражении, рейтинг перетасовался на три позиции.
Агент CHESS стоял четвёртым — поднялся с 62% до 81% и стал первым. OpenSearch-SQL стоял первым — опустился с 71% до 69% и стал третьим

То есть порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки

Две оговорки, без них нечестно

Команда Spider 2.0 обновила формулировки вопросов в июле 2025 и часть неоднозначностей сняла, а аудит делали по более раннему срезу. И 66.1% — это доля среди 121 проверенной задачи из 547, а не по всему датасету

Но вывод не меняется

Когда вам показывают девяносто с чем-то процентов на публичном text-to-SQL бенчмарке, в этой цифре есть вклад ошибок разметки. И ни вы, ни автор цифры не знаете, какой именно

Поэтому единственная осмысленная метрика для вашей компании — внутренний eval на ваших схемах, ваших определениях метрик и реальных вопросах бизнеса. Чужой лидерборд на этот вопрос не отвечает

А вы свои цифры точности на чём меряете?
2
Datanomika
Самая недооценённая работа этого года про text-to-SQL В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf). Четверо исследователей…
Практический вывод из этого прямой. Публичный лидерборд не отвечает на вопрос, насколько хорошо агент будет работать в вашей компании: он измеряет чужую систему на чужих схемах чужой разметкой.

Содержательный ответ даёт только внутренний eval на ваших определениях метрик, ваших схемах и ваших реальных ошибках.
Datanomika pinned «Самая недооценённая работа этого года про text-to-SQL В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf). Четверо исследователей…»
Forwarded from Devs.kz
Час назад стартанул Agentic AI Football Cup Almaty. Организаторы AWS Community. Партнеры BCC-HUB и Datanomix. Профессиональные фотки от AWS community будут позже. Пока любительская видео тут и фотки @devs_kz
🔥1
BI снова хоронят: подключаем LLM к хранилищу и аналитики больше не нужны, деньги тратить на лицензии не нужно.

По крайней мере, так выглядит обещание.

На практике дата-агент может написать корректный SQL, получить верные цифры и всё равно уверенно ответить не на тот бизнес-вопрос.
Он путается в определениях метрик, теряет права пользователя, дорого ходит по кругу и иногда рассуждает хуже, когда ему дают больше времени.

Я разобрал свежие кейсы OpenAI, Anthropic и Hex: что действительно улучшает ответы, какие очевидные подходы уже провалились, из чего складывается реальная стоимость и как за шесть шагов проверить

https://habr.com/ru/articles/1075946/
👌4