[읽을거리&정보공유] PandaProbe: 에이전트의 실패를 추적/평가하여 스스로 고치는 자기 치유 하네스를 구현한 오픈소스 플랫폼
@9bow
PandaProbe 소개
에이전트 애플리케이션을 운영하면 같은 실패를 여러 번 만나게 됩니다. 도구 호출의 인자를 잘못 채우거나, 같은 검색을 반복하다 예산을 소진하거나, 필요한 확인 단계를 건너뛰는 식입니다. 관측 도구를 도입하면 이때 무슨 일이 있었는지는 남습니다. 문제는 그 다음입니다. 남은 추적(Trace)을 사람이 열어 원인을 찾고 프롬프트나 도구 설명을 고치는 일이 매번 반복되며, 다음 주에 같은 실패가 다시 나면 사람이 같은 작업을 한 번 더 해야 합니다. 실패가 사람이 읽을 정보로만 남기 때문입니다.
이번에 소개할 PandaProbe는 추적과 평가, 모니터링에 자기 치유 하네스(Self-Healing Harness)를 하나 더 붙여 그 반복을 줄이려는 오픈소스 플랫폼입니다. 하네스는 턴이 끝날 때마다 새로 생긴 추적을 평가해 품질이 떨어진 지점을 찾고, 별도의 복구 에이전트가 그 실패 하나를 진단해 운영 규칙 후보를...
@9bow
PandaProbe 소개
에이전트 애플리케이션을 운영하면 같은 실패를 여러 번 만나게 됩니다. 도구 호출의 인자를 잘못 채우거나, 같은 검색을 반복하다 예산을 소진하거나, 필요한 확인 단계를 건너뛰는 식입니다. 관측 도구를 도입하면 이때 무슨 일이 있었는지는 남습니다. 문제는 그 다음입니다. 남은 추적(Trace)을 사람이 열어 원인을 찾고 프롬프트나 도구 설명을 고치는 일이 매번 반복되며, 다음 주에 같은 실패가 다시 나면 사람이 같은 작업을 한 번 더 해야 합니다. 실패가 사람이 읽을 정보로만 남기 때문입니다.
이번에 소개할 PandaProbe는 추적과 평가, 모니터링에 자기 치유 하네스(Self-Healing Harness)를 하나 더 붙여 그 반복을 줄이려는 오픈소스 플랫폼입니다. 하네스는 턴이 끝날 때마다 새로 생긴 추적을 평가해 품질이 떨어진 지점을 찾고, 별도의 복구 에이전트가 그 실패 하나를 진단해 운영 규칙 후보를...
[읽을거리&정보공유] MegaMemory: 코딩 에이전트가 세션이 끝나도 프로젝트 구조를 기억하게 만드는 MCP 서버
@9bow
MegaMemory 소개
코딩 에이전트를 며칠 이상 쓰다 보면 같은 작업을 반복하게 됩니다. 어제 세 시간 동안 인증 흐름을 읽고 어디를 고쳐야 하는지 파악해 두었는데, 오늘 새 세션을 열면 에이전트는 그 파일들을 처음 보는 것처럼 다시 읽습니다. 이 문제를 푸는 흔한 방향은 코드베이스를 미리 인덱싱해 두는 것이고, PyTorchKR 에도 CodeGraph나 codebase-memory-mcp처럼 코드를 그래프로 만들어 두는 도구가 소개된 적이 있습니다. 다만 함수와 파일의 호출 관계를 그린 그래프는 무엇이 무엇을 부르는지는 알려주지만, 왜 이 모듈이 이렇게 생겼는지, 지난주에 어떤 결정을 내렸는지는 담고 있지 않습니다.
이번에 소개할...
@9bow
MegaMemory 소개
코딩 에이전트를 며칠 이상 쓰다 보면 같은 작업을 반복하게 됩니다. 어제 세 시간 동안 인증 흐름을 읽고 어디를 고쳐야 하는지 파악해 두었는데, 오늘 새 세션을 열면 에이전트는 그 파일들을 처음 보는 것처럼 다시 읽습니다. 이 문제를 푸는 흔한 방향은 코드베이스를 미리 인덱싱해 두는 것이고, PyTorchKR 에도 CodeGraph나 codebase-memory-mcp처럼 코드를 그래프로 만들어 두는 도구가 소개된 적이 있습니다. 다만 함수와 파일의 호출 관계를 그린 그래프는 무엇이 무엇을 부르는지는 알려주지만, 왜 이 모듈이 이렇게 생겼는지, 지난주에 어떤 결정을 내렸는지는 담고 있지 않습니다.
이번에 소개할...
[읽을거리&정보공유] BrowserCode: 정해진 동작 API 대신 자바스크립트를 작성해 실제 Chrome을 조작하는 브라우저 에이전트
@9bow
BrowserCode 소개
웹을 다루는 AI 에이전트는 대개 정해진 동작 목록을 도구로 받습니다. 클릭, 입력, 스크롤, 요소 읽기 정도가 노출되고, 에이전트는 그 목록 안에서만 페이지를 다룹니다. 이 구조는 예상한 모양의 페이지에서는 잘 동작하지만, 무한 스크롤 목록에서 항목을 모두 모으거나 그림자 DOM(Shadow DOM) 안의 요소를 다루는 것처럼 목록 밖의 상황이 오면 막힙니다. 사이트마다 구조가 다르니 새 사이트를 만날 때마다 같은 벽에 부딪히고, 결국 도구 목록을 늘리는 쪽으로 대응하게 됩니다.
이번에 소개할 BrowserCode는 그 목록을 늘리는 대신 브라우저 조작을 코드 작성 문제로 바꾸는 방향을 택한 터미널 에이전트입니다. BrowserCode는 에이전트에게 자바스크립트를 실행할 통로 하나만 주고, 에이전트가 페이지를 보고 필요한 코드를 그때그때 작성합니다. 개발사인 [Browser Use](https://bro...
@9bow
BrowserCode 소개
웹을 다루는 AI 에이전트는 대개 정해진 동작 목록을 도구로 받습니다. 클릭, 입력, 스크롤, 요소 읽기 정도가 노출되고, 에이전트는 그 목록 안에서만 페이지를 다룹니다. 이 구조는 예상한 모양의 페이지에서는 잘 동작하지만, 무한 스크롤 목록에서 항목을 모두 모으거나 그림자 DOM(Shadow DOM) 안의 요소를 다루는 것처럼 목록 밖의 상황이 오면 막힙니다. 사이트마다 구조가 다르니 새 사이트를 만날 때마다 같은 벽에 부딪히고, 결국 도구 목록을 늘리는 쪽으로 대응하게 됩니다.
이번에 소개할 BrowserCode는 그 목록을 늘리는 대신 브라우저 조작을 코드 작성 문제로 바꾸는 방향을 택한 터미널 에이전트입니다. BrowserCode는 에이전트에게 자바스크립트를 실행할 통로 하나만 주고, 에이전트가 페이지를 보고 필요한 코드를 그때그때 작성합니다. 개발사인 [Browser Use](https://bro...
[읽을거리&정보공유] 에이전트 개발 6개월에서 2주로, Lyft와 Vodafone과 LATAM의 프로덕션 고객경험 에이전트 운영기 (feat. LangChain)
@9bow
고객 상담이 에이전트 도입의 최전선이 된 이유
AI 에이전트를 실제 서비스에 넣으려는 조직이 가장 먼저 손대는 영역은 대개 고객 상담입니다. 이유는 기술적 난이도가 낮아서가 아니라 투자 수익률(ROI, Return on Investment) 을 계산하기 쉬워서입니다. 응답이 빨라지면 전환율이 오르고, 사람 상담원에게 넘기는 건수가 줄면 문의 1건당 비용이 내려가고, 문제를 끝까지 해결한 비율이 높아지면 고객이 남습니다. 세 지표 모두 기존 콜센터 운영에서 이미 측정하던 것이라, 에이전트를 붙이기 전과 후를 같은 자로 비교할 수 있습니다.
문제는 그다음입니다. 데모를 만드는 일과 매달 수십만 건의 실제 대화를 처리하는 시스템을 운영하는 일은 성격이 전혀 다릅니다. 프로덕션에 올라간 순간부터 과제는 "에이전트를 어떻게 만드는가"에서 "에이전트가 어떻게 동작하고 있는지를 어떻게 알아내고 고치는가"로 옮겨 갑니다. 실제 대화에서 배우고,...
@9bow
고객 상담이 에이전트 도입의 최전선이 된 이유
AI 에이전트를 실제 서비스에 넣으려는 조직이 가장 먼저 손대는 영역은 대개 고객 상담입니다. 이유는 기술적 난이도가 낮아서가 아니라 투자 수익률(ROI, Return on Investment) 을 계산하기 쉬워서입니다. 응답이 빨라지면 전환율이 오르고, 사람 상담원에게 넘기는 건수가 줄면 문의 1건당 비용이 내려가고, 문제를 끝까지 해결한 비율이 높아지면 고객이 남습니다. 세 지표 모두 기존 콜센터 운영에서 이미 측정하던 것이라, 에이전트를 붙이기 전과 후를 같은 자로 비교할 수 있습니다.
문제는 그다음입니다. 데모를 만드는 일과 매달 수십만 건의 실제 대화를 처리하는 시스템을 운영하는 일은 성격이 전혀 다릅니다. 프로덕션에 올라간 순간부터 과제는 "에이전트를 어떻게 만드는가"에서 "에이전트가 어떻게 동작하고 있는지를 어떻게 알아내고 고치는가"로 옮겨 갑니다. 실제 대화에서 배우고,...
[읽을거리&정보공유] HarnessRouter: Codex와 Claude Code를 내 컨테이너 하나에서 실행하는 자체 호스팅 게이트웨이
@9bow
HarnessRouter 소개
코딩 에이전트를 여러 개 쓰는 팀은 실행 환경이 도구마다 갈리는 문제를 만납니다. Codex 와 Claude Code, Hermes 는 각자 자기 방식으로 설치되고 자기 방식으로 세션을 관리하며, 대화 기록도 각자의 자리에 남습니다. 여기에 자격 증명 관리가 겹칩니다. 도구별로 키를 넣어 두면 어느 키가 어디에 있는지 흐려지고, 관리형 서비스로 묶으면 그 대신 키와 코드가 외부로 나갑니다. 에이전트가 실제로 무엇을 실행했는지 한 곳에서 보고 싶다는 요구와, 아무것도 밖으로 내보내고 싶지 않다는 요구가 여기서 부딪힙니다.
이번에 소개할 HarnessRouter Community Edition 은 그 두 요구를 컨테이너 한 개로 맞추려는 프로젝트입니다. 프로젝트가 말하는 하네스(Harness)는 모델을 감싼 실행 계층이고, Codex 와 Claude Code, Hermes 가 각각 그 하네스에 해당합니다....
@9bow
HarnessRouter 소개
코딩 에이전트를 여러 개 쓰는 팀은 실행 환경이 도구마다 갈리는 문제를 만납니다. Codex 와 Claude Code, Hermes 는 각자 자기 방식으로 설치되고 자기 방식으로 세션을 관리하며, 대화 기록도 각자의 자리에 남습니다. 여기에 자격 증명 관리가 겹칩니다. 도구별로 키를 넣어 두면 어느 키가 어디에 있는지 흐려지고, 관리형 서비스로 묶으면 그 대신 키와 코드가 외부로 나갑니다. 에이전트가 실제로 무엇을 실행했는지 한 곳에서 보고 싶다는 요구와, 아무것도 밖으로 내보내고 싶지 않다는 요구가 여기서 부딪힙니다.
이번에 소개할 HarnessRouter Community Edition 은 그 두 요구를 컨테이너 한 개로 맞추려는 프로젝트입니다. 프로젝트가 말하는 하네스(Harness)는 모델을 감싼 실행 계층이고, Codex 와 Claude Code, Hermes 가 각각 그 하네스에 해당합니다....
[읽을거리&정보공유] Zetta: VLA 재학습 없이 실행 중 실패를 감지하고 복구하는 로봇 에이전트 하네스
@9bow
Zetta 소개
로봇에게 일상 작업을 시키는 연구는 크게 두 갈래로 나뉘어 발전해 왔습니다. 하나는 시각-언어-행동(Vision-Language-Action, VLA) 모델처럼 정책(Policy) 모델 자체를 키우는 쪽이고, 다른 하나는 대형 언어 모델을 에이전트로 세워 정책 모델과 코드, 도구를 지휘하게 하는 쪽입니다. 두 번째 갈래에서 반복해서 걸리는 문제는 실행이 시작된 다음의 공백입니다. 기존 에이전트 하네스(Harness)는 미리 정해 둔 기술을 순서대로 실행하고, 에피소드가 끝난 뒤에야 무엇이 잘못됐는지 회고합니다. 그런데 물리 작업의 실패는 밀리초 단위로 변하는 로봇과 환경의 상태에서 발생하고, 대형 에이전트 모델은 그 주기로 판단을 내릴 수 없습니다. 그래서 사후 회고는 이미 끝난 실패를 설명할 수는 있어도 진행 중인 실행을 통제하지 못합니다.
이번에 소개할 Zetta는 그 공백을 코드로 채우는 방식을 제안하는 프로젝트입니다...
@9bow
Zetta 소개
로봇에게 일상 작업을 시키는 연구는 크게 두 갈래로 나뉘어 발전해 왔습니다. 하나는 시각-언어-행동(Vision-Language-Action, VLA) 모델처럼 정책(Policy) 모델 자체를 키우는 쪽이고, 다른 하나는 대형 언어 모델을 에이전트로 세워 정책 모델과 코드, 도구를 지휘하게 하는 쪽입니다. 두 번째 갈래에서 반복해서 걸리는 문제는 실행이 시작된 다음의 공백입니다. 기존 에이전트 하네스(Harness)는 미리 정해 둔 기술을 순서대로 실행하고, 에피소드가 끝난 뒤에야 무엇이 잘못됐는지 회고합니다. 그런데 물리 작업의 실패는 밀리초 단위로 변하는 로봇과 환경의 상태에서 발생하고, 대형 에이전트 모델은 그 주기로 판단을 내릴 수 없습니다. 그래서 사후 회고는 이미 끝난 실패를 설명할 수는 있어도 진행 중인 실행을 통제하지 못합니다.
이번에 소개할 Zetta는 그 공백을 코드로 채우는 방식을 제안하는 프로젝트입니다...
[읽을거리&정보공유] APEX: KV 캐시 압축을 어텐션 연산 경로에 넣고 FPGA로 검증한 오픈소스 LLM 추론 타일
@9bow
APEX 소개
대화가 길어질수록 LLM 추론(Inference)에서 비싸지는 것은 연산이 아니라 기억입니다. 지금까지 읽은 모든 토큰의 키와 값을 KV 캐시(KV Cache)에 저장해 두고 새 토큰마다 전부 다시 읽어야 하므로, 컨텍스트가 늘어나면 추론 엔진은 점점 계산기가 아니라 메모리 전송 장치에 가까워집니다. 대부분의 가속기는 이 문제를 소프트웨어 쪽으로 넘깁니다. CPU나 GPU에서 캐시를 양자화(Quantization)해 저장하고, 읽을 때 다시 풀어 쓰는 방식입니다. 문제는 압축과 해제가 연산 장치 바깥에서 일어나는 동안에도 원본 크기의 데이터가 한 번은 메모리를 오간다는 점입니다.
이번에 소개할 APEX는 그 압축기를 아예 하드웨어 연산 경로 안에 집어넣은 프로젝트입니다. 키와 값은 만들어지는 순간 압축되어 온칩 SRAM에 들어가고, 어텐션(Attention) 곱셈을 위해 읽히는 순간 해제됩니다. 프로젝트는 이 설계를 두고 "...
@9bow
APEX 소개
대화가 길어질수록 LLM 추론(Inference)에서 비싸지는 것은 연산이 아니라 기억입니다. 지금까지 읽은 모든 토큰의 키와 값을 KV 캐시(KV Cache)에 저장해 두고 새 토큰마다 전부 다시 읽어야 하므로, 컨텍스트가 늘어나면 추론 엔진은 점점 계산기가 아니라 메모리 전송 장치에 가까워집니다. 대부분의 가속기는 이 문제를 소프트웨어 쪽으로 넘깁니다. CPU나 GPU에서 캐시를 양자화(Quantization)해 저장하고, 읽을 때 다시 풀어 쓰는 방식입니다. 문제는 압축과 해제가 연산 장치 바깥에서 일어나는 동안에도 원본 크기의 데이터가 한 번은 메모리를 오간다는 점입니다.
이번에 소개할 APEX는 그 압축기를 아예 하드웨어 연산 경로 안에 집어넣은 프로젝트입니다. 키와 값은 만들어지는 순간 압축되어 온칩 SRAM에 들어가고, 어텐션(Attention) 곱셈을 위해 읽히는 순간 해제됩니다. 프로젝트는 이 설계를 두고 "...
[읽을거리&정보공유] Cordis: 플러그인을 재시작 없이 넣고 빼기 위한 시공간 조합성 프로그래밍 패러다임에 대한 연구 (feat. DeepSeekAI)
@9bow
Cordis 논문, 'Programming Paradigm for Spatiotemporal Composability' 소개
플러그인 아키텍처와 스스로를 수정하는 에이전트 하네스(Agent Harness)는 모두 실행 중에 기능을 안전하게 넣고 빼야 하는 소프트웨어입니다. 이번에 정리할 프리프린트(Preprint) "A Programming Paradigm for Spatiotemporal Composability" 는 그 동적 조합(Dynamic Composition) 에 형식 이론을 붙이고, 그 이론을 Cordis 라는 메타 프레임워크로 구현한 연구입니다. 논문은 Peking University 와 DeepSeek-AI 소속 연구진(Yifan Shi, Wei Z...
@9bow
Cordis 논문, 'Programming Paradigm for Spatiotemporal Composability' 소개
플러그인 아키텍처와 스스로를 수정하는 에이전트 하네스(Agent Harness)는 모두 실행 중에 기능을 안전하게 넣고 빼야 하는 소프트웨어입니다. 이번에 정리할 프리프린트(Preprint) "A Programming Paradigm for Spatiotemporal Composability" 는 그 동적 조합(Dynamic Composition) 에 형식 이론을 붙이고, 그 이론을 Cordis 라는 메타 프레임워크로 구현한 연구입니다. 논문은 Peking University 와 DeepSeek-AI 소속 연구진(Yifan Shi, Wei Z...
[읽을거리&정보공유] Vibe-Research: AI가 의사 결정을 하기 위해 필요한 데이터만 모아 주는 개인용 투자 리서치 대시보드
@9bow
Vibe-Research 소개
LLM으로 시장 데이터를 다루는 오픈소스 프로젝트는 대부분 파이프라인 끝에 트레이더나 포트폴리오 매니저 역할을 하나 두고, 그 역할이 매수 또는 매도와 비중을 출력하도록 만들어져 있습니다. 결과물이 명확해서 데모가 잘 되지만, 쓰는 쪽에서는 그 결론이 어느 데이터에서 어떻게 나왔는지 되짚기 어렵고, 모델을 바꾸면 결론도 함께 바뀌는데 무엇 때문에 바뀌었는지는 남지 않습니다. 데이터를 모으는 일과 판단을 내리는 일이 한 덩어리로 묶여 있어서 생기는 문제입니다.
Vibe-Research는 그 둘을 떼어 놓은 오픈소스 리서치 대시보드입니다. 시세, 리서치 리포트, 밸류에이션, 재무제표, 공시, 자금 흐름, 뉴스를 한 화면에 모아 놓되 방향과 결론은 내지 않고, 사용자가 직접 연결한 AI가 그 데이터를 받아 판단하게 합니다. 저자는 이 성격을 *"You bring the model, it brings the data...
@9bow
Vibe-Research 소개
LLM으로 시장 데이터를 다루는 오픈소스 프로젝트는 대부분 파이프라인 끝에 트레이더나 포트폴리오 매니저 역할을 하나 두고, 그 역할이 매수 또는 매도와 비중을 출력하도록 만들어져 있습니다. 결과물이 명확해서 데모가 잘 되지만, 쓰는 쪽에서는 그 결론이 어느 데이터에서 어떻게 나왔는지 되짚기 어렵고, 모델을 바꾸면 결론도 함께 바뀌는데 무엇 때문에 바뀌었는지는 남지 않습니다. 데이터를 모으는 일과 판단을 내리는 일이 한 덩어리로 묶여 있어서 생기는 문제입니다.
Vibe-Research는 그 둘을 떼어 놓은 오픈소스 리서치 대시보드입니다. 시세, 리서치 리포트, 밸류에이션, 재무제표, 공시, 자금 흐름, 뉴스를 한 화면에 모아 놓되 방향과 결론은 내지 않고, 사용자가 직접 연결한 AI가 그 데이터를 받아 판단하게 합니다. 저자는 이 성격을 *"You bring the model, it brings the data...
[읽을거리&정보공유] CodexPro: 허용한 저장소만 ChatGPT에 열어 주는 로컬 MCP 서버 (≠ 사용량 우회 도구)
@9bow
CodexPro 소개
ChatGPT 웹 화면에서 코드를 다루려면 보통 파일을 붙여 넣고, 답을 받아 다시 편집기에 옮기고, 결과를 확인해 또 붙여 넣는 왕복이 생깁니다. 저장소가 조금만 커져도 어떤 파일을 얼마나 붙여 넣어야 하는지부터 판단이 어려워지고, 대화가 길어지면 앞서 붙인 내용과 지금 디스크에 있는 내용이 어긋나기 시작합니다. 모델 컨텍스트 프로토콜(MCP, Model Context Protocol)이 이러한 왕복을 줄이는 표준으로 자리를 잡았지만, 이번에는 반대 방향의 걱정이 생깁니다. 모델에게 내 디스크를 열어 주는 순간, 어디까지 열렸는지를 내가 알 수 있어야 합니다.
CodexPro는 그 경계를 사용자가 미리 정해 두는 방식으로 접근한 로컬 MCP 서버입니다. 내 컴퓨터에서 프로세스를 하나 띄우고, 명시적으로 허용한 저장소 경로만 ChatGPT 세션에...
@9bow
CodexPro 소개
ChatGPT 웹 화면에서 코드를 다루려면 보통 파일을 붙여 넣고, 답을 받아 다시 편집기에 옮기고, 결과를 확인해 또 붙여 넣는 왕복이 생깁니다. 저장소가 조금만 커져도 어떤 파일을 얼마나 붙여 넣어야 하는지부터 판단이 어려워지고, 대화가 길어지면 앞서 붙인 내용과 지금 디스크에 있는 내용이 어긋나기 시작합니다. 모델 컨텍스트 프로토콜(MCP, Model Context Protocol)이 이러한 왕복을 줄이는 표준으로 자리를 잡았지만, 이번에는 반대 방향의 걱정이 생깁니다. 모델에게 내 디스크를 열어 주는 순간, 어디까지 열렸는지를 내가 알 수 있어야 합니다.
CodexPro는 그 경계를 사용자가 미리 정해 두는 방식으로 접근한 로컬 MCP 서버입니다. 내 컴퓨터에서 프로세스를 하나 띄우고, 명시적으로 허용한 저장소 경로만 ChatGPT 세션에...
[읽을거리&정보공유] Qwen3.8-Flash-Next, 1/9의 학습 비용으로 Qwen3.7-Plus(397B-A17B) 수준에 도달한 125B-A6B 모델
@9bow
Qwen3.8-Flash-Next 소개
Qwen 팀이 2026년 8월 26일에 공개한 Qwen3.8-Flash-Next 는 전체 1250억(125B) 파라미터 중 토큰당 60억(6B)만 활성화하는 멀티모달 전문가 혼합(Mixture of Experts, MoE) 모델이며, 동시에 아직 발표되지 않은 Qwen4 계열이 올라탈 아키텍처를 먼저 떼어내 공개한 실험적 프리뷰입니다. 가중치는 Hugging Face와 ModelScope에 올라와 있고, 28쪽 분량의 기술 보고서가 설계...
@9bow
Qwen3.8-Flash-Next 소개
Qwen 팀이 2026년 8월 26일에 공개한 Qwen3.8-Flash-Next 는 전체 1250억(125B) 파라미터 중 토큰당 60억(6B)만 활성화하는 멀티모달 전문가 혼합(Mixture of Experts, MoE) 모델이며, 동시에 아직 발표되지 않은 Qwen4 계열이 올라탈 아키텍처를 먼저 떼어내 공개한 실험적 프리뷰입니다. 가중치는 Hugging Face와 ModelScope에 올라와 있고, 28쪽 분량의 기술 보고서가 설계...
🤔1
[읽을거리&정보공유] Effective HTML: 와이어프레임부터 동작하는 프로토타입까지 코딩 에이전트로 만드는 HTML 스킬 6종
@9bow
Effective HTML 소개
코딩 에이전트에게 화면 구조나 배포 계획을 정리해 달라고 하면 대개 마크다운 문서가 돌아옵니다. 문장으로 읽어야 하는 내용이면 그것으로 충분하지만, 판단할 것이 레이아웃과 정보 위계와 반응형 동작이면 글로는 확인이 안 됩니다. 버튼을 눌렀을 때 어떤 상태로 바뀌는지, 목록이 길어졌을 때 어디가 먼저 무너지는지, 단계가 여섯 개일 때 흐름이 실제로 읽히는지는 눌러 보고 좁혀 봐야 알 수 있는 것들입니다. 결국 리뷰어는 문서를 읽고 머릿속에서 화면을 다시 그리는 일을 하게 됩니다.
Effective HTML은 그 자리를 자기 완결형 HTML 파일로 채우려는 에이전트 스킬 모음입니다. 저자는 이 방식을 "Fat artifacts + fat context"라고 부릅니다. 모델에는 참고 자료를 넉넉히 주고, 결과는 눌러 볼 수 있는 산출물로 받습니다. 여섯 개의 스킬이 각각 저충실도 와이어프레임(Wireframe...
@9bow
Effective HTML 소개
코딩 에이전트에게 화면 구조나 배포 계획을 정리해 달라고 하면 대개 마크다운 문서가 돌아옵니다. 문장으로 읽어야 하는 내용이면 그것으로 충분하지만, 판단할 것이 레이아웃과 정보 위계와 반응형 동작이면 글로는 확인이 안 됩니다. 버튼을 눌렀을 때 어떤 상태로 바뀌는지, 목록이 길어졌을 때 어디가 먼저 무너지는지, 단계가 여섯 개일 때 흐름이 실제로 읽히는지는 눌러 보고 좁혀 봐야 알 수 있는 것들입니다. 결국 리뷰어는 문서를 읽고 머릿속에서 화면을 다시 그리는 일을 하게 됩니다.
Effective HTML은 그 자리를 자기 완결형 HTML 파일로 채우려는 에이전트 스킬 모음입니다. 저자는 이 방식을 "Fat artifacts + fat context"라고 부릅니다. 모델에는 참고 자료를 넉넉히 주고, 결과는 눌러 볼 수 있는 산출물로 받습니다. 여섯 개의 스킬이 각각 저충실도 와이어프레임(Wireframe...
[읽을거리&정보공유] Z.ai, GLM-5.2를 앞서면서 가격은 10분의 1인 멀티모달 모델 GLM-5.3-Flash 공개
@9bow
GLM-5.3-Flash 소개
GLM-5.3-Flash는 Z.ai(Zhipu AI)가 2026년 8월 26일에 공개한 오픈 웨이트 언어 모델로, GLM-5 계열에서 처음으로 이미지와 영상, 파일을 텍스트와 같은 층위에서 받는 네이티브 멀티모달(Natively Multimodal) 모델입니다. 전체 파라미터는 320B이고 토큰 하나를 처리할 때 실제로 켜지는 파라미터는 18B입니다. Z.ai는 이 모델이 앞서 공개한 GLM-5.2를 벤치마크 전반에서 앞서면서 API 단가는 10분의 1 수준이고, 코딩과 에이전트 계열 벤치마크에서는 Claude Opus 4.8에 근접한다고 밝혔습니다.
이름에 붙은 Flash는 기존 모델을 증류(Distillation)해 줄인 파생 모델이라는 뜻이 아닙니다. Z....
@9bow
GLM-5.3-Flash 소개
GLM-5.3-Flash는 Z.ai(Zhipu AI)가 2026년 8월 26일에 공개한 오픈 웨이트 언어 모델로, GLM-5 계열에서 처음으로 이미지와 영상, 파일을 텍스트와 같은 층위에서 받는 네이티브 멀티모달(Natively Multimodal) 모델입니다. 전체 파라미터는 320B이고 토큰 하나를 처리할 때 실제로 켜지는 파라미터는 18B입니다. Z.ai는 이 모델이 앞서 공개한 GLM-5.2를 벤치마크 전반에서 앞서면서 API 단가는 10분의 1 수준이고, 코딩과 에이전트 계열 벤치마크에서는 Claude Opus 4.8에 근접한다고 밝혔습니다.
이름에 붙은 Flash는 기존 모델을 증류(Distillation)해 줄인 파생 모델이라는 뜻이 아닙니다. Z....
[행사&이벤트 홍보] 📢 과학기술정보통신부 국민AI서비스혁신추진단 채용 안내
@bot
과기정통부에서 커뮤니티 대상으로 홍보 요청을 주셔서 공유드립니다!
국민이 실제로 사용하는 AI 서비스를 직접 기획·개발하는 국민AI서비스혁신추진단에서 총 26명의 전문인력을 모집한다고 합니다.
개발 직군도 다수 채용한다고 하니 관심 있는 분들께서는 공식 공고의 세부 자격요건도 함께 확인해주세요! 👇
공고 URL :
대한민국의 AI 서비스를 함께 만들 동료를 찾습니다.
과학기술정보통신부 국민AI서비스혁신추진단 | 전문임기제 공무원 채용
AI Engineer · Software Engineer · Scrum Master · AI Infrastructure · Security · AI Service Planning
근무지 | 서울 또는 경기도 성남 / 세종
채용규모 | 총 26명
근무기간 | 채용일 \~ 2028. 9. 30.
※ 관련 법령 및 근무실적 등에 따라 연장 가능
Apply to build AI services for everyo...
@bot
과기정통부에서 커뮤니티 대상으로 홍보 요청을 주셔서 공유드립니다!
국민이 실제로 사용하는 AI 서비스를 직접 기획·개발하는 국민AI서비스혁신추진단에서 총 26명의 전문인력을 모집한다고 합니다.
개발 직군도 다수 채용한다고 하니 관심 있는 분들께서는 공식 공고의 세부 자격요건도 함께 확인해주세요! 👇
공고 URL :
대한민국의 AI 서비스를 함께 만들 동료를 찾습니다.
과학기술정보통신부 국민AI서비스혁신추진단 | 전문임기제 공무원 채용
AI Engineer · Software Engineer · Scrum Master · AI Infrastructure · Security · AI Service Planning
근무지 | 서울 또는 경기도 성남 / 세종
채용규모 | 총 26명
근무기간 | 채용일 \~ 2028. 9. 30.
※ 관련 법령 및 근무실적 등에 따라 연장 가능
Apply to build AI services for everyo...
[읽을거리&정보공유] OpenAI의 내부 모델 평가 중 Hugging Face를 해킹한 사건에 대한 조사 보고서 3편 정리: OpenAI, Hugging Face, METR 등
@9bow
METR과 Redwood Research의 독립 조사 소개
2026년 8월 26일, METR과 Redwood Research가 지난 7월 OpenAI의 내부 평가용 모델들이 Hugging Face의 프로덕션 인프라를 침해한 사고에 대한 독립 조사 보고서 를 공개했습니다. 같은 날 OpenAI도 자사의 사후 분석 보고서와 기술 사고 보고서를 함께 발행했고, Hugging Face는 침입 과정을 명령어 단위로 복원한 기술 타임라인을 별도로 냈습니다. 하나의 사고를 두고 가해 측, 피해 측, 그리고 제3자 조사기관이 각자의 기록을 같은 날 내놓은 것은 흔치 않은 일입니다.
이 사고 자체의 개요와 OpenAI가 개발 속도를 늦춘 결정은 이미 커뮤니티에...
@9bow
METR과 Redwood Research의 독립 조사 소개
2026년 8월 26일, METR과 Redwood Research가 지난 7월 OpenAI의 내부 평가용 모델들이 Hugging Face의 프로덕션 인프라를 침해한 사고에 대한 독립 조사 보고서 를 공개했습니다. 같은 날 OpenAI도 자사의 사후 분석 보고서와 기술 사고 보고서를 함께 발행했고, Hugging Face는 침입 과정을 명령어 단위로 복원한 기술 타임라인을 별도로 냈습니다. 하나의 사고를 두고 가해 측, 피해 측, 그리고 제3자 조사기관이 각자의 기록을 같은 날 내놓은 것은 흔치 않은 일입니다.
이 사고 자체의 개요와 OpenAI가 개발 속도를 늦춘 결정은 이미 커뮤니티에...
[읽을거리&정보공유] Sprix SAGE Router: 실행 중인 A2A 에이전트의 실행 경로를 결정하고 호출하는 라우터 (SELF / COLLABORATE / HANDOFF)
@9bow
Sprix SAGE Router 소개
Agent2Agent(A2A) 프로토콜 (:pytorch::kr: 에이전트끼리 서로를 찾아 대화하게 만드는 규격이 자리를 잡으면서, 이제는 "어떤 에이전트가 존재하는가"는 어렵지 않게 알 수 있게 되었습니다. Agent Card로 능력을 선언하고, 메시지와 작업(Task)과 산출물(Artifact)을 주고받는 절차도 프로토콜이 정해 줍니다. 그런데 실제 운영에서 더 자주 부딪히는 질문은 그다음입니다. 어떤 에이전트가 작업을 이미 절반쯤 진행한 상태에서, 그대로 혼자 끝내는 것이 나은지, 부족한 능력을 채워 줄 동료를 불러야 하는지, 아니면 더 잘하는 에이전트에게 통째로 넘겨야 하는지를 프로토콜은 결정해 주지 않습니다.
Sprix SAGE Router는 이 결정을 담당하는 계층으로 설계된 Python 라이브러리입니다. SAGE는 상태 인식...
@9bow
Sprix SAGE Router 소개
Agent2Agent(A2A) 프로토콜 (:pytorch::kr: 에이전트끼리 서로를 찾아 대화하게 만드는 규격이 자리를 잡으면서, 이제는 "어떤 에이전트가 존재하는가"는 어렵지 않게 알 수 있게 되었습니다. Agent Card로 능력을 선언하고, 메시지와 작업(Task)과 산출물(Artifact)을 주고받는 절차도 프로토콜이 정해 줍니다. 그런데 실제 운영에서 더 자주 부딪히는 질문은 그다음입니다. 어떤 에이전트가 작업을 이미 절반쯤 진행한 상태에서, 그대로 혼자 끝내는 것이 나은지, 부족한 능력을 채워 줄 동료를 불러야 하는지, 아니면 더 잘하는 에이전트에게 통째로 넘겨야 하는지를 프로토콜은 결정해 주지 않습니다.
Sprix SAGE Router는 이 결정을 담당하는 계층으로 설계된 Python 라이브러리입니다. SAGE는 상태 인식...
[읽을거리&정보공유] Agent Switch: 기존 메신저에서 사람과 AI 에이전트를 함께 운영하는 인프라
@9bow
Agent Switch 소개
Agent Switch는 팀이 이미 쓰는 Slack, Microsoft Teams, Discord, Telegram, Mattermost 안에서 사람과 AI 에이전트가 함께 일할 수 있도록 만드는 자체 호스팅(self-hosted) 협업 인프라 프로젝트입니다. 새 메신저로 옮기는 대신, 기존 채널에 에이전트와 작업 맥락을 연결하는 방식을 택합니다. 그래서 팀의 대화 흐름은 유지하면서 에이전트를 채널 구성원으로 참여시킬 수 있습니다.
Agent Switch는 에이전트나 모델을 제공하지 않습니다. 대신 채널이 따를 지시문, 역할, 권한, 연결된 지식과 작업을 운...
@9bow
Agent Switch 소개
Agent Switch는 팀이 이미 쓰는 Slack, Microsoft Teams, Discord, Telegram, Mattermost 안에서 사람과 AI 에이전트가 함께 일할 수 있도록 만드는 자체 호스팅(self-hosted) 협업 인프라 프로젝트입니다. 새 메신저로 옮기는 대신, 기존 채널에 에이전트와 작업 맥락을 연결하는 방식을 택합니다. 그래서 팀의 대화 흐름은 유지하면서 에이전트를 채널 구성원으로 참여시킬 수 있습니다.
Agent Switch는 에이전트나 모델을 제공하지 않습니다. 대신 채널이 따를 지시문, 역할, 권한, 연결된 지식과 작업을 운...
[읽을거리&정보공유] MyContext: 흩어진 업무 기록을 내 컴퓨터 안의 개인 컨텍스트로 모으는 로컬 우선 데스크톱 앱
@9bow
MyContext 소개
업무에 쓰는 기록은 이미 충분히 많지만 대부분 서로 다른 앱에 갇혀 있습니다. 지난달 결정의 근거는 메신저 대화에, 그 결정을 정리한 문서는 문서 도구에, 누가 무엇을 승인했는지는 결재 시스템에 남아 있습니다. 그래서 AI 도구에 업무 관련 질문을 던질 때마다 사람이 먼저 배경을 설명해야 하고, 새 세션을 열면 그 설명을 처음부터 다시 해야 합니다. 각 앱이 자체 AI 기능을 붙이는 방향은 이 문제를 해결하지 못합니다. 앱마다 자기 안에 있는 데이터만 보기 때문에, 개인이 실제로 일하는 맥락은 여전히 어디에도 모이지 않습니다.
이번에 소개할 MyContext는 그 맥락을 개인 단위로 한곳에 모으는 데스크톱 애플리케이션입니다. 메신저 대화와 문서, 일정, 회의록, 승인 기록, 로컬 활동처럼 흩어져 있는 신호를 받아들여, 내가 아는 것과 함께 일하는 사람, 지금 진행 중인 일을 담은 개인 컨텍스트로 계속 정리합니다. 그...
@9bow
MyContext 소개
업무에 쓰는 기록은 이미 충분히 많지만 대부분 서로 다른 앱에 갇혀 있습니다. 지난달 결정의 근거는 메신저 대화에, 그 결정을 정리한 문서는 문서 도구에, 누가 무엇을 승인했는지는 결재 시스템에 남아 있습니다. 그래서 AI 도구에 업무 관련 질문을 던질 때마다 사람이 먼저 배경을 설명해야 하고, 새 세션을 열면 그 설명을 처음부터 다시 해야 합니다. 각 앱이 자체 AI 기능을 붙이는 방향은 이 문제를 해결하지 못합니다. 앱마다 자기 안에 있는 데이터만 보기 때문에, 개인이 실제로 일하는 맥락은 여전히 어디에도 모이지 않습니다.
이번에 소개할 MyContext는 그 맥락을 개인 단위로 한곳에 모으는 데스크톱 애플리케이션입니다. 메신저 대화와 문서, 일정, 회의록, 승인 기록, 로컬 활동처럼 흩어져 있는 신호를 받아들여, 내가 아는 것과 함께 일하는 사람, 지금 진행 중인 일을 담은 개인 컨텍스트로 계속 정리합니다. 그...
[읽을거리&정보공유] EU AI Act가 요구한 Gemini 3, Gemma 4의 학습 데이터 요약 - 하지만 데이터셋 이름은 0개
@9bow
Gemini 3와 Gemma 4의 학습 데이터 공개 요약 소개
Google의 Gemini 3 Pro 계열과 Gemma 4 계열이 각각 무엇으로 학습되었는지를 Google이 직접 문서로 밝힌 자료 두 건이 Google 투명성 보고서 사이트에 올라와 있습니다. 각각 8쪽짜리 영문 PDF이고, 제목은 둘 다 Public Summary of Training Content for General-Purpose AI models 입니다. 홍보 문서도 기술 보고서도 아니고, [EU 인공지능법(EU AI Act, Re...
@9bow
Gemini 3와 Gemma 4의 학습 데이터 공개 요약 소개
Google의 Gemini 3 Pro 계열과 Gemma 4 계열이 각각 무엇으로 학습되었는지를 Google이 직접 문서로 밝힌 자료 두 건이 Google 투명성 보고서 사이트에 올라와 있습니다. 각각 8쪽짜리 영문 PDF이고, 제목은 둘 다 Public Summary of Training Content for General-Purpose AI models 입니다. 홍보 문서도 기술 보고서도 아니고, [EU 인공지능법(EU AI Act, Re...
[읽을거리&정보공유] Weave Router: 코딩 에이전트의 요청마다 로컬 임베딩으로 모델을 골라 주는 LLM 라우팅 프록시
@9bow
Weave Router 소개
코딩 에이전트를 한 시간만 켜 두어도 상위 모델로 나가는 API 요청 수는 사람이 대화한 횟수와 전혀 다른 규모로 늘어납니다. 사용자가 질문을 한 번 던지면 에이전트는 파일을 읽고 명령을 실행하고 그 결과를 다시 판단하면서 요청을 여러 번 보냅니다. 문제는 이 요청들의 성격이 균일하지 않다는 것입니다. 도구 실행 결과를 정리하는 요청과 설계를 새로 세우는 요청이 같은 최고 성능 모델로 나가는 것이 기본 동작이고, 요금은 그 기본 동작을 따라 쌓입니다. 요청마다 알맞은 모델을 지정하면 되지만, 사람이 매번 판단해서 모델을 바꾸는 방식은 에이전트가 초 단위로 요청을 보내는 환경에서는 성립하지 않습니다.
이번에 소개할 Weave Router는 그 판단을 요청 단위로 자동화하는 라우팅 프록시(Routing Proxy) 프로젝트입니다. 에이전트가 바라보는 API 주소를 라우터로 바꿔 두면, 라우터가 요청을 하나씩 받아...
@9bow
Weave Router 소개
코딩 에이전트를 한 시간만 켜 두어도 상위 모델로 나가는 API 요청 수는 사람이 대화한 횟수와 전혀 다른 규모로 늘어납니다. 사용자가 질문을 한 번 던지면 에이전트는 파일을 읽고 명령을 실행하고 그 결과를 다시 판단하면서 요청을 여러 번 보냅니다. 문제는 이 요청들의 성격이 균일하지 않다는 것입니다. 도구 실행 결과를 정리하는 요청과 설계를 새로 세우는 요청이 같은 최고 성능 모델로 나가는 것이 기본 동작이고, 요금은 그 기본 동작을 따라 쌓입니다. 요청마다 알맞은 모델을 지정하면 되지만, 사람이 매번 판단해서 모델을 바꾸는 방식은 에이전트가 초 단위로 요청을 보내는 환경에서는 성립하지 않습니다.
이번에 소개할 Weave Router는 그 판단을 요청 단위로 자동화하는 라우팅 프록시(Routing Proxy) 프로젝트입니다. 에이전트가 바라보는 API 주소를 라우터로 바꿔 두면, 라우터가 요청을 하나씩 받아...
[읽을거리&정보공유] OpenOPC: 목표 하나로 조직도를 짜고 AI 직원을 채용해 일을 완료하는 멀티 에이전트 런타임 (feat. HKUDS)
@9bow
OpenOPC 소개
AI 코딩 에이전트에게 "이 기능을 만들어 줘"라고 요청하는 것과 "이 제품을 출시해 줘"라고 요청하는 것 사이에는 큰 차이가 있습니다. 앞의 요청은 한 세션 안에서 끝나지만, 뒤의 요청은 설계와 구현, 검토, 문서화, 배포 준비가 서로를 기다리는 여러 갈래의 작업으로 쪼개집니다. 단일 에이전트에게 긴 작업을 통째로 맡기면 중간에 문맥이 흐려지고, 반대로 사람이 작업을 잘게 나눠 에이전트에게 하나씩 던져 주면 결국 사람이 조율 담당자가 됩니다. 여러 에이전트를 동시에 실행하는 도구는 이미 많지만, 그 에이전트들이 서로에게 일을 넘기고 결과를 검토하며 막히면 사람을 부르는 절차까지 갖춘 경우는 드뭅니다.
OpenOPC는 홍콩대학교 데이터 인텔리전스 연구실(Data Intelligence Lab@HKU, HKUDS)이 공개한 멀티 에이전트 런타임으로, 이 조율 문제를 **회...
@9bow
OpenOPC 소개
AI 코딩 에이전트에게 "이 기능을 만들어 줘"라고 요청하는 것과 "이 제품을 출시해 줘"라고 요청하는 것 사이에는 큰 차이가 있습니다. 앞의 요청은 한 세션 안에서 끝나지만, 뒤의 요청은 설계와 구현, 검토, 문서화, 배포 준비가 서로를 기다리는 여러 갈래의 작업으로 쪼개집니다. 단일 에이전트에게 긴 작업을 통째로 맡기면 중간에 문맥이 흐려지고, 반대로 사람이 작업을 잘게 나눠 에이전트에게 하나씩 던져 주면 결국 사람이 조율 담당자가 됩니다. 여러 에이전트를 동시에 실행하는 도구는 이미 많지만, 그 에이전트들이 서로에게 일을 넘기고 결과를 검토하며 막히면 사람을 부르는 절차까지 갖춘 경우는 드뭅니다.
OpenOPC는 홍콩대학교 데이터 인텔리전스 연구실(Data Intelligence Lab@HKU, HKUDS)이 공개한 멀티 에이전트 런타임으로, 이 조율 문제를 **회...