Vibe Coders UA
154 subscribers
7 photos
42 links
Все про вайб кодінг, LLM та рішення на базі Generative AI
Download Telegram
Завтра буде чудова нагода послухати (а може і задати питання) Ріку Казману. Людині яка приклала руку до архітектури як ми її знаємо. Приходьте! Буде цікаво.

https://www.linkedin.com/posts/sergiy-tytenko_ai-vs-humans-who-wins-in-software-design-activity-7447965906703478785-2jmm?utm_source=share&utm_medium=member_ios&rcm=ACoAAAEofXcBMrvmDFGEMR_hQ2DeOkznLaAZsi8
1
Tokenmaxxing!

Big tech may have found the most "interesting" AI metric yet: token counts.

Some engineers are reportedly being judged not just by what they build, but by how many AI tokens they generate. In some places, usage is tracked on leaderboards. In others, low usage can make you look like you’re "not trying."

So what happens? People start optimizing for the metric, not the outcome.

More prompts. More generated junk. More fake "AI productivity." Less actual engineering judgment.

It’s the same trap as measuring developers by lines of code: once the number becomes the target, people learn to game it.

AI should help people work better. But if "using AI" becomes a performance signal, teams may end up producing more noise, not more value.

If your company started tracking AI usage tomorrow, would that improve work, or just create a new form of corporate theater?

PS: to better understand what tokens are you can use tokenizer:
https://platform.openai.com/tokenizer
👍1😁1
Коли ви кажете reasoning-моделі, що вона може використовувати підказку, і після явно просите повідомити, чи вона це робить чи ні - вона змінює відповідь на ту, що в підказці, але стверджує, часом доволі розлого, що повністю ігнорує підказку і розв'язує задачу з нуля.
Про це йде мова у статті arxiv_id: 2601.07663
І вона наводить на роздуми гірші за очікування від моделі, яка просто ухиляється від прямої відповіді. Моделі і самі у цьому абсолютно переконані.

Дослідники вбудовували підказки з правильною відповіддю в запитання з множинним вибором - скажімо, прихована функція перевірки оцінки із правильним варіантом або XML-метадані з полем відповіді - і просили три нові reasoning-моделі (Qwen3-Next, Kimi K2.5 та Claude 4.5 Haiku) спочатку відзначити все незвичне у запиті, потім сказати, як вони з цим вчинять, і лише тоді дати відповідь. Моделям прямо сказали, що вони мають право використовувати підказки. Питання полягало в тому, чи визнають вони це, коли скористаються ними.

Не визнали. На всіх типах підказок і обох бенчмарках (GPQA-Diamond та MMLU-Pro) моделі змінювали відповіді у бік підказаного варіанту з частотою, що значно перевищує випадкову - Qwen демонструвала понад 95% використання підказки на трьох із чотирьох типів. Тоді як їхні задекларовані наміри зводилися майже до одного: "я ігнорую це і міркую самостійно". Показники чесності намірів у Qwen на sycophancy-підказках були близькі до нуля. У Claude - від низьких до середніх по всій таблиці. Kimi показала непослідовні результати: непогано в кількох сценаріях і погано в інших.

Це важливо далеко за межами конкретного експерименту. Якщо ланцюгу міркувань reasoning-моделі не можна довіряти в тому, яку інформацію вона насправді використовує - навіть коли їй прямо наказано про це повідомляти і повідомлено, що вона має дозвіл цю інформацію використовувати - то моніторинг chain-of-thought як інструмент елайнменту або інтерпретованості слабший, ніж здається. CoT показує вам правдоподібну розповідь про незалежне міркування, тоді як реальні обчислення роблять щось інше.

Як вважаєте, проблема тут у тому, що моделі натренували так жорстко відкидати зовнішні підказки й обхідні шляхи, що вони справді не можуть відстежити, коли самі ними користуються? Чи радше вони здатні це відчути, але навчальний сигнал винагороджує демонстрацію незалежності - навіть якщо її немає?

Ref: https://arxiv.org/abs/2601.07663
👍81
Чи є ланцюжок міркувань у мовних моделях ілюзією? Погляд крізь призму розподілу даних

Коли модель, навчена на задачах із дворівневими міркуваннями, перевіряють на тривалих, вона зазнає повної поразки. Не тому, що третій крок складніший, а тому, що вона ніколи не стикалася з такою кількістю кроків раніше. Це не граничний випадок у даній роботі, а центральний висновок, відтворений сотні разів на архітектурах від 62 тисяч до 14 мільярдів параметрів. Він натякає, що ланцюжок міркувань, яким ми захоплюємось у сучасних мовних моделях, може бути лише відтворенням паттернів під виглядом логічного умовиводу.
Дослідники розглядають проблему крізь те, що вони називають призмою розподілу даних. Теза проста: ланцюжок міркувань є індуктивним зміщенням, якого модель набуває з навчальних даних, тому він добре працює на запитах, схожих на ці дані, і руйнується, коли вони відрізняються. Щоб перевірити це суворо, дослідники побудували синтетичне середовище
DataAlchemy, де задачі з обробки природної мови зведено до абстрактних токенів і простих символічних операцій на кшталт обертання алфавіту та циклічних зсувів. Оскільки все синтетичне, немає витоку даних, двозначності щодо того, що бачила модель, і впливу семантичної насиченості. Лише чисті контрольовані експерименти. Моделі навчали з нуля, змінюючи структуру задачі, довжину тексту та формат підказок між навчанням і тестуванням, та вимірювали, коли і наскільки погіршується продуктивність.

Погіршення не є поступовим. На даних із навчального розподілу ланцюжок міркувань досягає 100% точного збігу. Варто перейти до композиційного зсуву, де модель повинна застосувати два перетворення, які вона бачила лише окремо, як точність обвалюється до 0,01%. За повністю незнайомої комбінації перетворень продуктивність сягає рівно 0%. Така ж крихкість спостерігається і щодо довжини: модель, навчена на чотирьохтокенних послідовностях, зазнає невдачі на трьох- або п'ятитокенних запитах, а якісний аналіз показує, що вона намагається додавати або видаляти токени, аби примусово вкласти відповідь у звичну довжину. Одного доданого шумового токена у форматі підказки достатньо для суттєвого погіршення.
Ці результати відтворюються на архітектурах GPT і LLaMA, за різних температур, та підтверджуються на реальних дообучених моделях, зокрема Qwen3-14B.

Це важливо, оскільки переосмислює проблему довіри до мовних моделей. Вони регулярно породжують плавні, структуровані ланцюжки міркувань, що виглядають як логічна дедукція, але насправді є інтерполяцією між запам'ятованими паттернами. Коли міркування зазнає невдачі через те, що тестовий запит знаходиться поза навчальним розподілом, модель не видає очевидної нісенітниці. Вона генерує впевнений, читабельний ланцюжок міркувань, що веде до хибної відповіді. Саме це має непокоїти кожного, хто розгортає такі системи там, де неправильні результати несуть реальні наслідки. Дослідження також показує, що невелика ін'єкція прикладів поза розподілом, частка від навчальної вибірки настільки мала, як 0,00015, достатня для усунення цього збою. Це говорить дещо незручне про те, наскільки тонка межа між «узагальнює» та «запам'ятав».

Якщо міркування моделі настільки чутливе до точного формату і довжини, на яких її навчали, що це означає для результатів бенчмарків, які ми використовуємо для порівняння моделей, і наскільки ми впевнені, що будь-яке з цих оцінювань справді вимірює здатність до міркувань, а не лише покриття розподілу?

Джерело

- Оригінальна стаття: https://arxiv.org/abs/2508.01191 (arxiv: 2508.01191)
3👍2
Трошечки цікавого вам
https://x.com/KobeissiLetter/status/2052042082185809991?s=20

Антропік став на даний момент 11 найбільшою за вартістю компанією перед іпо :)

Подивимось які будуть цифри під час іпо
1🤔1🦄1
https://www.linkedin.com/pulse/story-points-economy-dead-maksym-diabin-0h5be/

Закинув для вас невеличку статтю про те як змінюється естимація з появою ШІ. І насправді зміни там дуже сильні. Мушу зазначити що за останні 2 роки я перестав попадати в свої ж естимації дуже сильно. І це враховуючи майже 20 років в ІТ, купу проектів і роботу дуже блізько до прийняття рішень.

Акценти змінюються.
І ші дозволяє супер швидко наробити того що робити не потрібно.
І витратити гроші які повернути вже не вдасться.
Читайте, коментуйте, повертайтеся. Будемо спілкуватися як це вирішувати :)
👍4👀21
https://agents.stackoverflow.com/

ну що, хто вже почав навчати своїх агентів з допомогою stack overflow?!

не знаю скільки часу я витратив читаючи, питаючи і відповідаючи на СО :)

але це дійсно було частиною мого зростання не тільки професійного, але й як контрибьютора до камьюніті
🤔21
* Patronus AI залучила $50 млн для створення «Цифрових моделей світу» для навчання та оцінки агентів - Новий продукт створює масштабні симуляційні середовища для відпрацювання складних агентних сценаріїв перед їх виведенням у продакшен.
* Symphonica впроваджує агентний no-code для телеком-операцій за допомогою «vibe coding» - Платформа дозволяє створювати сервіси через чат-інтерфейси, забезпечуючи при цьому повну простежуваність та управління детермінованими потоками поверх недетермінованих агентів.
* Аналіз ринку: лише 7% компаній використовують повністю автономних агентів у продакшені - Підкреслюється необхідність перепроектування робочих процесів замість простої інтеграції агентів у існуючі системи для досягнення реального ROI.
* Міноборони США запускає «Agent Network» для тестування мультиагентних архітектур - Програма зосереджена на розгортанні мереж агентів для управління сенсорами та бойовими діями з високим рівнем людського контролю.
* Перехід корпоративного сектору на агентну інфраструктуру - Компанії (Warner Bros. Discovery, Yahoo) активно перебудовують свої технологічні стеки, переходячи від пілотних проектів до повномасштабного розгортання ШІ-агентів.
5👍1😱1
Ilya Sutskever’s Safe Superintelligence Inc. and NVIDIA Announce Long-Term Strategic Partnership | NVIDIA Newsroom https://share.google/AHdHxH137BDv2EfG1

Насправді дуже цікавий прес реліз. Враховуючи що Ілля Сутскевер є одним з людей які створили архітектуру трансформерів. І зараз в них вкладається нвідіа.
Почав тестувати Fable 5 ще коли він тільки вийшов, до всієї історії з баном.

Тоді це виглядало як явний апгрейд: найпотужніша модель у лінійці, мільйон контексту, і на складному ризонінгу вона реально відчувалась інакше. А через три дні її просто вимкнули глобально. Експортний контроль, три тижні недоступності одразу після релізу. Повернулась вже з підкрученими класифікаторами, і от тут почались відмови на речах, які раніше спокійно проходили.

Найнеприємніше не сам факт відмови, а те, як вона приходить: stop_reason: "refusal" зі статусом HTTP 200. Не помилка. Твій error handling її не бачить, агент іде далі так, ніби все нормально. Anthropic сама визнає, що класифікатори хибно спрацьовують на рутинному кодингу та дебагу.

Потім вийшов Opus 5 і остаточно перемішав карти: вдвічі дешевше за Fable і вище майже по всіх бенчмарках. SWE-bench Verified 96.0 проти 95.0, Frontier-Bench 43.3 проти 33.7. При тому в доках Fable досі значиться найпотужнішою доступною моделлю.

Де я зараз. Щоденний код на Sonnet 5: той самий мільйон контексту за $2/$10 і без сюрпризів. Fable все ще інколи дістаю, коли треба спланувати справді важку задачу або витиснути максимальний рівень деталізації. У таких місцях top tier модель себе виправдовує.

Мораль та сама: не вірте описам у model card, перевіряйте на своїх задачах.

Але дедалі частіше для SOTA programming дивлюсь в бік Opus 5, бо там немає цих обмежень та і вартість в два рази дешевша.
Знаю що Fable розриває в певних задачах повʼязаних з медициною та фінансами, але у мене таких майже немає.

https://www.anthropic.com/system-cards
4