Forwarded from Data Secrets | Карьера
Новое исследование от Anthropic показывает, что разработчики, которые используют ИИ для изучения программирования, показывают худшие результаты на тестах.
Исследователи набрали джунов, которые работали с Python как минимум год, но не работали с библиотекой Trio. Участников разделили на две группы: у одной был доступ к GPT-4o, а у второй группы была только документация.
Затем все участники прошли тест на знание концепций. Как итог, группа с доступом к ИИ набрала на 17% меньше баллов, чем вторая. При этом использование ИИ почти не экономило время разработчиков.
Исследователи набрали джунов, которые работали с Python как минимум год, но не работали с библиотекой Trio. Участников разделили на две группы: у одной был доступ к GPT-4o, а у второй группы была только документация.
Затем все участники прошли тест на знание концепций. Как итог, группа с доступом к ИИ набрала на 17% меньше баллов, чем вторая. При этом использование ИИ почти не экономило время разработчиков.
👍5
Data Secrets | Карьера
Новое исследование от Anthropic показывает, что разработчики, которые используют ИИ для изучения программирования, показывают худшие результаты на тестах. Исследователи набрали джунов, которые работали с Python как минимум год, но не работали с библиотекой…
Тут наверное побуду защитником ИИ)
Проводили много эксперитментов когда люди которые вообще не думали, а давали задачи на откуп ИИ в обучении сами потом плохо усваивали информацию, это база. Но я так же видел исследования где люди не просто тупо ctrl + c и ctrl + v из ИИ, а юзали его вместо условного гугла, но сами разбирались и думали, там результаты не хуже людей без использования ИИ, а местами даже лучше. Так что тут все таки вопрос скорее в каком формате вы используете ИИ, если как помошник который подскажет в трудный момент и разьяснит, то все впорядке
Проводили много эксперитментов когда люди которые вообще не думали, а давали задачи на откуп ИИ в обучении сами потом плохо усваивали информацию, это база. Но я так же видел исследования где люди не просто тупо ctrl + c и ctrl + v из ИИ, а юзали его вместо условного гугла, но сами разбирались и думали, там результаты не хуже людей без использования ИИ, а местами даже лучше. Так что тут все таки вопрос скорее в каком формате вы используете ИИ, если как помошник который подскажет в трудный момент и разьяснит, то все впорядке
💯10👍2
Forwarded from Банкста
В крупнейшем исследовании медицинского ИИ приняли участие более 100 тыс. женщин Швеции. Как пишет Lancet, исследователи сравнили результаты работы радиолога + ИИ и двух радиологов. В ходе наблюдения установили, что добавление ИИ привело к увеличению числа выявленных случаев рака на 29% и снижению рабочей нагрузки на 44%. @banksta
❤1
Банкста
В крупнейшем исследовании медицинского ИИ приняли участие более 100 тыс. женщин Швеции. Как пишет Lancet, исследователи сравнили результаты работы радиолога + ИИ и двух радиологов. В ходе наблюдения установили, что добавление ИИ привело к увеличению числа…
Не смотря на то что все пытаются внедрить ИИ в программирование и другие сферы, на мой взгляд именно медицина самый хорошая почва для ИИ, поиск скрытых корреляций, анализ снимков, поиск редких заболеваний на основе симптомов, со всем этим отлично справляются нейросети
❤12
OpenAI отказывается от бенча SWE Verified, ровно по тем причинам про которые я писал раньше, ждем более адекватные варианты тестов
https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/
https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/
Telegram
Копай глубже
Вы знаете что я последнее время очень интересовался бенчмарками по кодингу для LLM, в первую очередь потому что это единственная +- реальная метрика на которую можно положится для общего понимания насколько модели хорошо могут писать код.
Погружаясь в мир…
Погружаясь в мир…
😁5👍1
Несмотря на то что текущие LLM модели уже неплохо развились, все еще считаю что LLM в текущем виде это не путь к AGI. Нужна кординальная смена архитектуры, от простого обучения на большом количестве текста, к созданию world like модели со всеми законами физики, в котором машина сама через взаимодействие сможет обучаться всему. Тогда уйдут типичные проблемы с ответами на вопросы с запаяным верхом кружки и открытым дном, и мойкой авто через 100 метров и тд. Попытки создать такие виртуальные миры уже к слову есть, например проект Nvidia Cosmos
https://habr.com/ru/news/1003706/
https://habr.com/ru/news/1003706/
NVIDIA
NVIDIA Cosmos: World Foundation Models Powering Physical AI
Explore NVIDIA Cosmos, a platform featuring world foundation models, advanced tokenizers, and guardrails, designed to boost physical AI for AVs and robots with fast model training and development.
👍3
Forwarded from Denis News
A GitHub Issue Title Compromised 4,000 Developer Machines (Score: 27 pts in 12 hours)
A GitHub issue title was used to inject a prompt that installed OpenClaw on 4,000 developer machines via a chain of vulnerabilities, including prompt injection, cache poisoning, and credential theft.
Link: grith.ai/blog/clinejection-when-your-ai-tool-installs-another
Comments: lobste.rs/s/efkl8m/github_issue_title_compromised_4_000
A GitHub issue title was used to inject a prompt that installed OpenClaw on 4,000 developer machines via a chain of vulnerabilities, including prompt injection, cache poisoning, and credential theft.
Link: grith.ai/blog/clinejection-when-your-ai-tool-installs-another
Comments: lobste.rs/s/efkl8m/github_issue_title_compromised_4_000
grith.ai
A GitHub Issue Title Compromised 4,000 Developer Machines
A prompt injection in a GitHub issue triggered a chain reaction that ended with 4,000 developers getting OpenClaw installed without consent. The attack composes well-understood vulnerabilities into something new: one AI tool bootstrapping another.
Исследование EsoLang‑Bench от Lossfunk показало, что даже топовые модели (GPT‑5.2, O4‑mini, Gemini 3 Pro, Qwen3‑235B, Kimi K2) почти не умеют программировать на эзотерических языках вроде Brainfuck, Whitespace и Befunge‑98 — их точность там 0–11%, против высоких результатов на обычных бенчмарках.
Ни одна модель не решила ни одной задачи выше уровня «Easy», а GPT‑5.2 не смогла сложить 5+7 на Brainfuck, а на Whitespace все модели дали 0% по синтаксической корректности.
Полезнее всего оказался цикл «код → ошибка → исправление», а few‑shot, LLM‑критик и ReAct дали лишь +~0,8 п.п.
EsoLang‑Bench наглядно показывает: современные LLM всё ещё запоминают паттерны, а не умеют переносить вычислительные навыки на незнакомый синтаксис.
Сам бенч
https://github.com/Lossfunk/EsolangBench
Ни одна модель не решила ни одной задачи выше уровня «Easy», а GPT‑5.2 не смогла сложить 5+7 на Brainfuck, а на Whitespace все модели дали 0% по синтаксической корректности.
Полезнее всего оказался цикл «код → ошибка → исправление», а few‑shot, LLM‑критик и ReAct дали лишь +~0,8 п.п.
EsoLang‑Bench наглядно показывает: современные LLM всё ещё запоминают паттерны, а не умеют переносить вычислительные навыки на незнакомый синтаксис.
Сам бенч
https://github.com/Lossfunk/EsolangBench
GitHub
GitHub - Lossfunk/EsolangBench
Contribute to Lossfunk/EsolangBench development by creating an account on GitHub.
👍5
Посмотрел доклад Яндекс про развитие AI в разработке, в целом советую к просмотру чтобы быть в курсе что вообще делают большие компании сейчас.
Но хотел бы обратить ваше внимание на этот скрин. Прямо сейчас все усилия по внедрению AI дают прирост 2% к перфу, очень оптимистичная цель до 10%, это к слову о х10 роста перфа и о том что кто-то кого-то заменит.
И тут можно задать логичный вопрос, стоят ли эти триллионы долларов такой скромный буст? Это еще не ясно какое влияние на
качество там есть.
Но это все если что не значит что не нужно смотреть на мейнстрим и пробовать самому, для части задачи это правда работает
видео
https://youtu.be/67izYAopMxY?si=XDegfodLYlaRW6C8
Но хотел бы обратить ваше внимание на этот скрин. Прямо сейчас все усилия по внедрению AI дают прирост 2% к перфу, очень оптимистичная цель до 10%, это к слову о х10 роста перфа и о том что кто-то кого-то заменит.
И тут можно задать логичный вопрос, стоят ли эти триллионы долларов такой скромный буст? Это еще не ясно какое влияние на
качество там есть.
Но это все если что не значит что не нужно смотреть на мейнстрим и пробовать самому, для части задачи это правда работает
видео
https://youtu.be/67izYAopMxY?si=XDegfodLYlaRW6C8
🔥8👍2💯1
Сегодня хочу посоветовать к просмотру доклад с конференции Яндекса для тимлидов.
Как ИИ меняет инженерную культуру и что это значит для тимлидов и инженеров
Будет интересно не только лидам, но и разработчикам, как бы мы не хотели, но индустрия меняется и нужно быть в контексте изменений, без лишнего пафоса и х20 ускорений, структурный подход с замерами метрик и тд. такое мне нравится)
https://youtu.be/JMV0ni9TPwM?t=13210
Как ИИ меняет инженерную культуру и что это значит для тимлидов и инженеров
Будет интересно не только лидам, но и разработчикам, как бы мы не хотели, но индустрия меняется и нужно быть в контексте изменений, без лишнего пафоса и х20 ускорений, структурный подход с замерами метрик и тд. такое мне нравится)
https://youtu.be/JMV0ni9TPwM?t=13210
YouTube
Dream → Teamlead
Dream → Teamlead — практическая конференция Яндекса для тимлидов, руководителей и технических лидеров. Здесь говорят не про код и фичи, а про управление людьми, принятие сложных решений и развитие здоровых команд.
00:00:00 Открытие
00:05:20 Доклад: Физиология…
00:00:00 Открытие
00:05:20 Доклад: Физиология…
👍3
Сегодня у меня для вас интересная статья об инженере из гугла который после месяца работы через клод решил все выкинуть и начать сначала, о причинах в статье)
https://lalitm.com/post/building-syntaqlite-ai/
https://lalitm.com/post/building-syntaqlite-ai/
Lalit Maganti
Eight years of wanting, three months of building with AI
For eight years, I’ve wanted a high-quality set of devtools for working with SQLite. Given how important SQLite is to the industry1, I’ve long been puzzled that no one has invested in building a really good developer experience for it2.
A couple of weeks…
A couple of weeks…
😁7