Beer::Code🍺
3.64K subscribers
36 photos
4 videos
147 links
Тут публікуються короткі замітки про PHP, Linux, Unit Testing, DB, OOP тощо, витяги зі статей, книг, відео, курсів та інших матеріалів.

Тепер тобі більше не потрібно перегортати тонни інформації ;)

@genkovich — написати автору каналу.
Download Telegram
А старі моделі часом не пишуть краще? 🤔

Я помітив, що читати тексти, які видає AI, стало складніше. Вони якісь менш складені, перевантажені менш природні чи бог його знає які

😅 І я це прям дуже добре помітив на своєму прикладі. У мене є бот, який присилає мені новинний дайджест. І останнім часом його читати стало просто неможливо

Трошки подосліджував цю тему і згадав, що багато текстів, які мені подобались, я свого часу генерував на Opus 4.5. На Opus 4.7, мені здається, вже почало ставати трохи гірше.

Знову ж таки - це чисто суб’єктивна думка, тому не засуджуйте 😄

👉 Спробував прогнати це через claude-opus-4-5, і шо я побачив, що текст легше читається і легше сприймається. Тобто мені реально більше подобається як стара модель пише 🙂

Попри те, що Opus 4.5 коштує стільки ж, скільки 5, у мене виникло логічне питання:

❓навіщо платити стільки ж за старішу модель?

Але по факту вона:
• швидше видає результат;
• суб’єктивно пише простіше;
• і результат мені банально більше подобається.

📌 Можливо це через новий tokenizer Anthropic, котрий з'явився починаючи з Claude 4.7 (доречі самі антропіки пишуть, що він генерує на 30% більше токенів тексту). Тобто теоретично, стара модель все ж таки буде коштувати трошки дешевше.

📌 Або можливо вотермарк, хоча Anthropic звісно пишуть, що він не повинен помітно впливати на якість або читабельність тексту (ще б вони стверждували щось інше)

Коротше цікаво те, що умовно «тупіша» або старіша модель може бути для конкретної задачі навіть кращою

Я ще спробував Haiku, але він мені вже здався доволі тупим 😄 Але тепер цікаво поганяти ще й GPT-шні моделі

Цікаво, чи помічали ви таке? Чи користуєтесь старішими / слабшими моделями для якихось конкретних задач?

Або, можливо, у вас є якісь свої skills, prompts або інші фішки, якими ви робите генеровані тексти більш адекватними та читабельними?

Youtube | Instagram
❤11🔥9👀6👍3
І знову я зі своїм воркшопом 🙂

Але перед цим - попереджаю і кажу чесно, канал і соцмережі в наступні тижні будуть трошки оживати, моя команда розширюється і зможуть мені допомогти взяти на себе більше обовʼязків, щоб я в свою чергу міг давати більше інфи. Буду тестувати нові формати тут, та буду вдячний за фідбек

Тепер до основної теми

Я вже провів кілька воркшопів з Agentic Engineering Workflow за останні місяці. Кожного разу після ефіру отримую повідомлення від тих, хто пропустив, а чи буде ще
Буде!

17 і 19 вересня проводжу ще один:

📅 17 вересня, 19:00 (Київ) - теорія: як агент працює під капотом, чому щось постійно забуває, чому вгадує, що з цим робити
📅 19 вересня, 13:00 (Київ) - практика: повний шлях фічі від ідеї до коду, показую на своєму робочому проекті, а ви паралельно - тренуєтесь кожний на своєму

Практику проходять усі учасники.

Також обовʼязково буде Q&A і в перший і в другий день. Можна (і треба) приходити зі своїми питаннями, проєктами, кейсами.
Запис буде! правда-правда 🙂 У кожного учасника буде доступ і одразу після зустрічі

Якщо ще не були - запрошую приєднатись😌

Деталі: https://agenticengineering.it.com/workflow-september17

Youtube | Instagram
🔥7❤3💩2🗿2👀1
Не можу не поділитись, вчора отримав такий відгук

Це прям паливо заради якого хочеться продовжувати створювати подібні матеріали і надалі ❤️
Please open Telegram to view this post
VIEW IN TELEGRAM
👍28🔥17❤3⚡1
Please open Telegram to view this post
VIEW IN TELEGRAM
👍36❤8🔥8❤‍🔥1
Хочу поділитись своєю мотивацією

На тому тижні був воркшоп Agentic Engineering Workflow

Кожного разу після двох днів ловлю себе на думці, що просто кайфую від того, що відбувається і що вдається зараз робити з командою

От правда, отримую щире задоволення від фідбеку який ви постійно даєте, а головне, що все що вдається віддати від себе - знаходить застосування в ваших проектах, в вашій роботі або для особистого розвитку

Зробив декілька скрінів під час воркшопу з чатику

Дякую всім, хто був 🤝
І що даєте такий приємний фідбек, від цього хочеться створювати ще більше
❤13🔥8👍1
Доречі, цього тижня буду проводити НОВИЙ воркшоп

Harness Engineering - 24 і 26 вересня.

Одна і та сама модель при використанні Cursor, Claude Code, Opencode буде давати різний результат. І різниця саме в харнесі. Харнес - це все, що навколо моделі: системний промпт, тули, пермішени, контекст, хуки, ретраї. Саме він вирішує, що модель бачить і що їй дозволено.

📅 Четвер, 24.09, 19:00 - харнес зсередини
Як воно працює під копотом, як замінити системний промпт. Чому правила в CLAUDE.md і AGENTS.md ігноруються, а хуки - ніколи. Практика: Напишемо свого агента, напилимо харнес, накинемо промпт, додамо два тули, свій хук.

📅 Субота, 26.09, 13:00 - Які є харнеси і фреймворки на ринку
DeepSeek Harness, Pi, Hermes, Eve, Flue - розбираємо і порівнюємо. Практика: свій харнес на Flue під задачу, на безкоштовній моделі.

Що отримаєет: Розуміння, як напилити свого агента, як працює харнес, які готові інструменти є для цього, записи і матеріали на платформі (на 6 місяців), сертифікат.

Воркшоп розрахований на розробників, інженерів, Tech Lead'ів, CTO. Практика проводиться на TypeScript, підписки будуть не потрібні.

Програма та опис на сайті переходьте
👉 Деталі й реєстрація
👍5❤4👀2
Anthropic випустила Opus 5.5


За словами Anthropic, на більшості задач вона працює на рівні Fable 5.1, а обходиться на 40% дешевше за Opus 5. Токени подешевшали до $4 і $20 відповідно.


📍 Фоллбеки на інші моделі


Opus 5.5 вийшла із запобіжниками, подібними до тих, що є у Fable 5.1. Запити з кібербезпеки здебільшого обробляє Opus 4.8. Запити з біології та з розробки frontier LLM передаються на Opus 5.

Звичайні пошук і виправлення багів у власному коді мають залишатись за Opus 5.5.

Для задач з кібербезпеки модель відкриватимуть рівнями через Cyber Verification Program, яку обіцяють розширити найближчими тижнями.


❓ Вимірювати стає дедалі складніше


Відрив у бенчмарках дедалі гірше показує, наскільки одна модель справді краща за іншу. Крім того, Opus 5.5 часто підозрює (!), що його тестують, і компанії через це важче передбачити його поведінку в реальних умовах. Хз як вони це зрозуміли :)

Anthropic очікує, що чим сильнішими ставатимуть моделі, тим гострішою буде ця проблема, якщо дослідники не просунуться в interpretability, тобто в розумінні того, що відбувається всередині моделі.

Виходить, що і бенчмарки можливостей, і перевірки безпеки від самого розробника дають дедалі менш точну картину. Найнадійнішим інструментом лишаються власні evals на власних задачах.


Ну що, погнали тестувати 😌


Youtube | Instagram
👍20🔥5❤2❤‍🔥1
Сувора QA Конференція: AI в тестуванні

Друзі, буду спікером на онлайн конфі, котра стартує буквально завтра 😅 а я все ніяк не встагав всіх попередити

Доволі багато кльових спікерів і тем, то ж запрошую доєднатись :)

Сайт конфи: conference.grygorenko.tech

📅 Мій виступ: середа, 30 вересня, ранок, 10:00 (Київ) -
🎤 Тема: «Як не стати жертвою AI slop» на котрій дам 10 практичних порад, як організувати роботу з AI-агентами в проєкті, не витрачати час на зайвий код, пропущені вимоги і повторне виправлення помилок

Думаю, буде супер цікаво не тільки QA, то ж не пропустіть :)

🎁 Промокод від мене: sulimovskyi
❤8👍5🔥1