PyTorchKR
144 subscribers
697 links
PyTorchKR 커뮤니티의 새로운 글을 알립니다. AI/ML 분야의 최신 소식들과 주요 연구/프로젝트들을 만나보세요!
Download Telegram
[읽을거리&정보공유] APEX: KV 캐시 압축을 어텐션 연산 경로에 넣고 FPGA로 검증한 오픈소스 LLM 추론 타일
@9bow

APEX 소개

대화가 길어질수록 LLM 추론(Inference)에서 비싸지는 것은 연산이 아니라 기억입니다. 지금까지 읽은 모든 토큰의 키와 값을 KV 캐시(KV Cache)에 저장해 두고 새 토큰마다 전부 다시 읽어야 하므로, 컨텍스트가 늘어나면 추론 엔진은 점점 계산기가 아니라 메모리 전송 장치에 가까워집니다. 대부분의 가속기는 이 문제를 소프트웨어 쪽으로 넘깁니다. CPU나 GPU에서 캐시를 양자화(Quantization)해 저장하고, 읽을 때 다시 풀어 쓰는 방식입니다. 문제는 압축과 해제가 연산 장치 바깥에서 일어나는 동안에도 원본 크기의 데이터가 한 번은 메모리를 오간다는 점입니다.

이번에 소개할 APEX는 그 압축기를 아예 하드웨어 연산 경로 안에 집어넣은 프로젝트입니다. 키와 값은 만들어지는 순간 압축되어 온칩 SRAM에 들어가고, 어텐션(Attention) 곱셈을 위해 읽히는 순간 해제됩니다. 프로젝트는 이 설계를 두고 "...
[읽을거리&정보공유] Cordis: 플러그인을 재시작 없이 넣고 빼기 위한 시공간 조합성 프로그래밍 패러다임에 대한 연구 (feat. DeepSeekAI)
@9bow

Cordis 논문, 'Programming Paradigm for Spatiotemporal Composability' 소개

플러그인 아키텍처와 스스로를 수정하는 에이전트 하네스(Agent Harness)는 모두 실행 중에 기능을 안전하게 넣고 빼야 하는 소프트웨어입니다. 이번에 정리할 프리프린트(Preprint) "A Programming Paradigm for Spatiotemporal Composability" 는 그 동적 조합(Dynamic Composition) 에 형식 이론을 붙이고, 그 이론을 Cordis 라는 메타 프레임워크로 구현한 연구입니다. 논문은 Peking University 와 DeepSeek-AI 소속 연구진(Yifan Shi, Wei Z...
[읽을거리&정보공유] Vibe-Research: AI가 의사 결정을 하기 위해 필요한 데이터만 모아 주는 개인용 투자 리서치 대시보드
@9bow

Vibe-Research 소개

LLM으로 시장 데이터를 다루는 오픈소스 프로젝트는 대부분 파이프라인 끝에 트레이더나 포트폴리오 매니저 역할을 하나 두고, 그 역할이 매수 또는 매도와 비중을 출력하도록 만들어져 있습니다. 결과물이 명확해서 데모가 잘 되지만, 쓰는 쪽에서는 그 결론이 어느 데이터에서 어떻게 나왔는지 되짚기 어렵고, 모델을 바꾸면 결론도 함께 바뀌는데 무엇 때문에 바뀌었는지는 남지 않습니다. 데이터를 모으는 일과 판단을 내리는 일이 한 덩어리로 묶여 있어서 생기는 문제입니다.

Vibe-Research는 그 둘을 떼어 놓은 오픈소스 리서치 대시보드입니다. 시세, 리서치 리포트, 밸류에이션, 재무제표, 공시, 자금 흐름, 뉴스를 한 화면에 모아 놓되 방향과 결론은 내지 않고, 사용자가 직접 연결한 AI가 그 데이터를 받아 판단하게 합니다. 저자는 이 성격을 *"You bring the model, it brings the data...
[읽을거리&정보공유] CodexPro: 허용한 저장소만 ChatGPT에 열어 주는 로컬 MCP 서버 (≠ 사용량 우회 도구)
@9bow

CodexPro 소개

ChatGPT 웹 화면에서 코드를 다루려면 보통 파일을 붙여 넣고, 답을 받아 다시 편집기에 옮기고, 결과를 확인해 또 붙여 넣는 왕복이 생깁니다. 저장소가 조금만 커져도 어떤 파일을 얼마나 붙여 넣어야 하는지부터 판단이 어려워지고, 대화가 길어지면 앞서 붙인 내용과 지금 디스크에 있는 내용이 어긋나기 시작합니다. 모델 컨텍스트 프로토콜(MCP, Model Context Protocol)이 이러한 왕복을 줄이는 표준으로 자리를 잡았지만, 이번에는 반대 방향의 걱정이 생깁니다. 모델에게 내 디스크를 열어 주는 순간, 어디까지 열렸는지를 내가 알 수 있어야 합니다.

CodexPro는 그 경계를 사용자가 미리 정해 두는 방식으로 접근한 로컬 MCP 서버입니다. 내 컴퓨터에서 프로세스를 하나 띄우고, 명시적으로 허용한 저장소 경로만 ChatGPT 세션에...
[읽을거리&정보공유] Qwen3.8-Flash-Next, 1/9의 학습 비용으로 Qwen3.7-Plus(397B-A17B) 수준에 도달한 125B-A6B 모델
@9bow

Qwen3.8-Flash-Next 소개

Qwen 팀이 2026년 8월 26일에 공개한 Qwen3.8-Flash-Next 는 전체 1250억(125B) 파라미터 중 토큰당 60억(6B)만 활성화하는 멀티모달 전문가 혼합(Mixture of Experts, MoE) 모델이며, 동시에 아직 발표되지 않은 Qwen4 계열이 올라탈 아키텍처를 먼저 떼어내 공개한 실험적 프리뷰입니다. 가중치는 Hugging Face와 ModelScope에 올라와 있고, 28쪽 분량의 기술 보고서가 설계...
🤔1
[읽을거리&정보공유] Effective HTML: 와이어프레임부터 동작하는 프로토타입까지 코딩 에이전트로 만드는 HTML 스킬 6종
@9bow

Effective HTML 소개

코딩 에이전트에게 화면 구조나 배포 계획을 정리해 달라고 하면 대개 마크다운 문서가 돌아옵니다. 문장으로 읽어야 하는 내용이면 그것으로 충분하지만, 판단할 것이 레이아웃과 정보 위계와 반응형 동작이면 글로는 확인이 안 됩니다. 버튼을 눌렀을 때 어떤 상태로 바뀌는지, 목록이 길어졌을 때 어디가 먼저 무너지는지, 단계가 여섯 개일 때 흐름이 실제로 읽히는지는 눌러 보고 좁혀 봐야 알 수 있는 것들입니다. 결국 리뷰어는 문서를 읽고 머릿속에서 화면을 다시 그리는 일을 하게 됩니다.

Effective HTML은 그 자리를 자기 완결형 HTML 파일로 채우려는 에이전트 스킬 모음입니다. 저자는 이 방식을 "Fat artifacts + fat context"라고 부릅니다. 모델에는 참고 자료를 넉넉히 주고, 결과는 눌러 볼 수 있는 산출물로 받습니다. 여섯 개의 스킬이 각각 저충실도 와이어프레임(Wireframe...
[읽을거리&정보공유] Z.ai, GLM-5.2를 앞서면서 가격은 10분의 1인 멀티모달 모델 GLM-5.3-Flash 공개
@9bow

GLM-5.3-Flash 소개

GLM-5.3-Flash는 Z.ai(Zhipu AI)가 2026년 8월 26일에 공개한 오픈 웨이트 언어 모델로, GLM-5 계열에서 처음으로 이미지와 영상, 파일을 텍스트와 같은 층위에서 받는 네이티브 멀티모달(Natively Multimodal) 모델입니다. 전체 파라미터는 320B이고 토큰 하나를 처리할 때 실제로 켜지는 파라미터는 18B입니다. Z.ai는 이 모델이 앞서 공개한 GLM-5.2를 벤치마크 전반에서 앞서면서 API 단가는 10분의 1 수준이고, 코딩과 에이전트 계열 벤치마크에서는 Claude Opus 4.8에 근접한다고 밝혔습니다.

이름에 붙은 Flash는 기존 모델을 증류(Distillation)해 줄인 파생 모델이라는 뜻이 아닙니다. Z....
[행사&이벤트 홍보] 📢 과학기술정보통신부 국민AI서비스혁신추진단 채용 안내
@bot

과기정통부에서 커뮤니티 대상으로 홍보 요청을 주셔서 공유드립니다!
국민이 실제로 사용하는 AI 서비스를 직접 기획·개발하는 국민AI서비스혁신추진단에서 총 26명의 전문인력을 모집한다고 합니다.

개발 직군도 다수 채용한다고 하니 관심 있는 분들께서는 공식 공고의 세부 자격요건도 함께 확인해주세요! 👇
공고 URL :

대한민국의 AI 서비스를 함께 만들 동료를 찾습니다.
과학기술정보통신부 국민AI서비스혁신추진단 | 전문임기제 공무원 채용

AI Engineer · Software Engineer · Scrum Master · AI Infrastructure · Security · AI Service Planning
근무지 | 서울 또는 경기도 성남 / 세종
채용규모 | 총 26명
근무기간 | 채용일 \~ 2028. 9. 30.
※ 관련 법령 및 근무실적 등에 따라 연장 가능

Apply to build AI services for everyo...
[읽을거리&정보공유] OpenAI의 내부 모델 평가 중 Hugging Face를 해킹한 사건에 대한 조사 보고서 3편 정리: OpenAI, Hugging Face, METR 등
@9bow

METR과 Redwood Research의 독립 조사 소개

2026년 8월 26일, METR과 Redwood Research가 지난 7월 OpenAI의 내부 평가용 모델들이 Hugging Face의 프로덕션 인프라를 침해한 사고에 대한 독립 조사 보고서 를 공개했습니다. 같은 날 OpenAI도 자사의 사후 분석 보고서와 기술 사고 보고서를 함께 발행했고, Hugging Face는 침입 과정을 명령어 단위로 복원한 기술 타임라인을 별도로 냈습니다. 하나의 사고를 두고 가해 측, 피해 측, 그리고 제3자 조사기관이 각자의 기록을 같은 날 내놓은 것은 흔치 않은 일입니다.

이 사고 자체의 개요와 OpenAI가 개발 속도를 늦춘 결정은 이미 커뮤니티에...
[읽을거리&정보공유] Sprix SAGE Router: 실행 중인 A2A 에이전트의 실행 경로를 결정하고 호출하는 라우터 (SELF / COLLABORATE / HANDOFF)
@9bow

Sprix SAGE Router 소개

Agent2Agent(A2A) 프로토콜 (:pytorch::kr: 에이전트끼리 서로를 찾아 대화하게 만드는 규격이 자리를 잡으면서, 이제는 "어떤 에이전트가 존재하는가"는 어렵지 않게 알 수 있게 되었습니다. Agent Card로 능력을 선언하고, 메시지와 작업(Task)과 산출물(Artifact)을 주고받는 절차도 프로토콜이 정해 줍니다. 그런데 실제 운영에서 더 자주 부딪히는 질문은 그다음입니다. 어떤 에이전트가 작업을 이미 절반쯤 진행한 상태에서, 그대로 혼자 끝내는 것이 나은지, 부족한 능력을 채워 줄 동료를 불러야 하는지, 아니면 더 잘하는 에이전트에게 통째로 넘겨야 하는지를 프로토콜은 결정해 주지 않습니다.

Sprix SAGE Router는 이 결정을 담당하는 계층으로 설계된 Python 라이브러리입니다. SAGE는 상태 인식...
[읽을거리&정보공유] Agent Switch: 기존 메신저에서 사람과 AI 에이전트를 함께 운영하는 인프라
@9bow

Agent Switch 소개

Agent Switch는 팀이 이미 쓰는 Slack, Microsoft Teams, Discord, Telegram, Mattermost 안에서 사람과 AI 에이전트가 함께 일할 수 있도록 만드는 자체 호스팅(self-hosted) 협업 인프라 프로젝트입니다. 새 메신저로 옮기는 대신, 기존 채널에 에이전트와 작업 맥락을 연결하는 방식을 택합니다. 그래서 팀의 대화 흐름은 유지하면서 에이전트를 채널 구성원으로 참여시킬 수 있습니다.

Agent Switch는 에이전트나 모델을 제공하지 않습니다. 대신 채널이 따를 지시문, 역할, 권한, 연결된 지식과 작업을 운...
[읽을거리&정보공유] MyContext: 흩어진 업무 기록을 내 컴퓨터 안의 개인 컨텍스트로 모으는 로컬 우선 데스크톱 앱
@9bow

MyContext 소개

업무에 쓰는 기록은 이미 충분히 많지만 대부분 서로 다른 앱에 갇혀 있습니다. 지난달 결정의 근거는 메신저 대화에, 그 결정을 정리한 문서는 문서 도구에, 누가 무엇을 승인했는지는 결재 시스템에 남아 있습니다. 그래서 AI 도구에 업무 관련 질문을 던질 때마다 사람이 먼저 배경을 설명해야 하고, 새 세션을 열면 그 설명을 처음부터 다시 해야 합니다. 각 앱이 자체 AI 기능을 붙이는 방향은 이 문제를 해결하지 못합니다. 앱마다 자기 안에 있는 데이터만 보기 때문에, 개인이 실제로 일하는 맥락은 여전히 어디에도 모이지 않습니다.

이번에 소개할 MyContext는 그 맥락을 개인 단위로 한곳에 모으는 데스크톱 애플리케이션입니다. 메신저 대화와 문서, 일정, 회의록, 승인 기록, 로컬 활동처럼 흩어져 있는 신호를 받아들여, 내가 아는 것과 함께 일하는 사람, 지금 진행 중인 일을 담은 개인 컨텍스트로 계속 정리합니다. 그...
[읽을거리&정보공유] EU AI Act가 요구한 Gemini 3, Gemma 4의 학습 데이터 요약 - 하지만 데이터셋 이름은 0개
@9bow

Gemini 3와 Gemma 4의 학습 데이터 공개 요약 소개

Google의 Gemini 3 Pro 계열과 Gemma 4 계열이 각각 무엇으로 학습되었는지를 Google이 직접 문서로 밝힌 자료 두 건이 Google 투명성 보고서 사이트에 올라와 있습니다. 각각 8쪽짜리 영문 PDF이고, 제목은 둘 다 Public Summary of Training Content for General-Purpose AI models 입니다. 홍보 문서도 기술 보고서도 아니고, [EU 인공지능법(EU AI Act, Re...
[읽을거리&정보공유] Weave Router: 코딩 에이전트의 요청마다 로컬 임베딩으로 모델을 골라 주는 LLM 라우팅 프록시
@9bow

Weave Router 소개

코딩 에이전트를 한 시간만 켜 두어도 상위 모델로 나가는 API 요청 수는 사람이 대화한 횟수와 전혀 다른 규모로 늘어납니다. 사용자가 질문을 한 번 던지면 에이전트는 파일을 읽고 명령을 실행하고 그 결과를 다시 판단하면서 요청을 여러 번 보냅니다. 문제는 이 요청들의 성격이 균일하지 않다는 것입니다. 도구 실행 결과를 정리하는 요청과 설계를 새로 세우는 요청이 같은 최고 성능 모델로 나가는 것이 기본 동작이고, 요금은 그 기본 동작을 따라 쌓입니다. 요청마다 알맞은 모델을 지정하면 되지만, 사람이 매번 판단해서 모델을 바꾸는 방식은 에이전트가 초 단위로 요청을 보내는 환경에서는 성립하지 않습니다.

이번에 소개할 Weave Router는 그 판단을 요청 단위로 자동화하는 라우팅 프록시(Routing Proxy) 프로젝트입니다. 에이전트가 바라보는 API 주소를 라우터로 바꿔 두면, 라우터가 요청을 하나씩 받아...
[읽을거리&정보공유] OpenOPC: 목표 하나로 조직도를 짜고 AI 직원을 채용해 일을 완료하는 멀티 에이전트 런타임 (feat. HKUDS)
@9bow

OpenOPC 소개

AI 코딩 에이전트에게 "이 기능을 만들어 줘"라고 요청하는 것과 "이 제품을 출시해 줘"라고 요청하는 것 사이에는 큰 차이가 있습니다. 앞의 요청은 한 세션 안에서 끝나지만, 뒤의 요청은 설계와 구현, 검토, 문서화, 배포 준비가 서로를 기다리는 여러 갈래의 작업으로 쪼개집니다. 단일 에이전트에게 긴 작업을 통째로 맡기면 중간에 문맥이 흐려지고, 반대로 사람이 작업을 잘게 나눠 에이전트에게 하나씩 던져 주면 결국 사람이 조율 담당자가 됩니다. 여러 에이전트를 동시에 실행하는 도구는 이미 많지만, 그 에이전트들이 서로에게 일을 넘기고 결과를 검토하며 막히면 사람을 부르는 절차까지 갖춘 경우는 드뭅니다.

OpenOPC는 홍콩대학교 데이터 인텔리전스 연구실(Data Intelligence Lab@HKU, HKUDS)이 공개한 멀티 에이전트 런타임으로, 이 조율 문제를 **회...
[읽을거리&정보공유] WeMM-Embedding: 2B 모델로 8B 베이스라인을 넘어선 범용 멀티모달 임베딩에 대한 연구
@9bow

WeMM-Embedding 소개

검색창 하나로 텍스트와 영상을 함께 찾는다는 것

사진첩에서 "작년 여름 바닷가"를 찾을 때 우리는 파일명을 기억해 내지 않습니다. 장면을 떠올리고, 그 장면과 가장 비슷해 보이는 것을 눈으로 고릅니다. 검색 시스템이 이 일을 대신하려면 사진과 문장을 같은 기준으로 잴 수 있어야 하는데, 이러한 역할을 하는 것이 바로 임베딩(embedding)입니다. (:pytorch::kr: 임베딩에 대한 자세한 내용은 다음 글을 참고해주세요:

WeMM-Embedding은 Tencent의 WeChat Vision 팀이 공개한 범용 멀티모달 임베딩(universal multimodal embedding) 모델군으로, 텍스트와 이미지, 영상, 시각 문서(visual document), 그리고 이들이 임의로 뒤섞인 입력까지 하나의 조밀한 벡터 공간에 담는 것을 목표로 합니다. 이 연구는 서로 다른 형태의 콘텐...
[읽을거리&정보공유] Rocketnotes: 내 문서에 질문하고 제텔카스텐 수집함을 AI가 정리하는 오픈소스 마크다운 노트 앱
@9bow

Rocketnotes 소개

개발자가 몇 년에 걸쳐 쌓은 메모는 대개 두 가지 문제를 동시에 갖습니다. 첫째로 문서가 늘어날수록 필요한 내용이 어느 문서에 있었는지 기억나지 않고, 키워드가 정확히 일치하지 않으면 검색으로도 찾히지 않습니다. 둘째로 회의 중이나 이동 중에 남긴 짧은 메모 조각들이 어디에도 속하지 못한 채 쌓입니다. 나중에 제자리를 찾아 주려면 결국 사람이 문서를 하나씩 열어 보며 어디에 붙일지 판단해야 하는데, 그 작업이 밀리면서 메모 더미가 그대로 방치됩니다.

Rocketnotes는 이 두 문제를 노트 앱 안에서 처리하려는 오픈소스 프로젝트입니다. 자신이 쌓은 문서를 대상으로 자연어 질문을 던져 답을 받을 수 있고, 의미 기반 검색으로 표현이 달라도 관련 문서를 찾아냅니다. 그리고 제텔카스텐(Zettelkasten) 수집함에 넣어 둔 메모 조각을 AI 에이전트가 분석해 가장 관련 있는 기존 문서 안으로 옮겨 넣습니다.

R...
[읽을거리&정보공유] OptMem: 데이터베이스도 임베딩도 없이 로그와 이진 트리로 만든 AI 에이전트용 영속 메모리
@9bow

OptMem 소개

코딩 에이전트에게 기억을 붙이는 방법은 대체로 한 방향으로 수렴해 왔습니다. 대화를 잘라 임베딩으로 바꾸고 벡터 데이터베이스에 넣은 뒤, 새 질문이 오면 비슷한 조각을 검색해 프롬프트에 끼워 넣는 방식입니다. 이 구조는 잘 동작하지만 붙이는 비용이 작지 않습니다. 임베딩 모델과 벡터 저장소를 고르고 운영해야 하고, 검색이 무엇을 가져왔는지가 사람 눈에 잘 보이지 않으며, 무엇이 왜 기억되었는지 확인하려면 다시 도구를 하나 더 열어야 합니다. 개인 작업 환경에 붙이기에는 무거운 편입니다.

OptMem은 그 반대 방향에서 출발한 프로젝트입니다. 임베딩도 벡터 데이터베이스도 쓰지 않고, 한 줄씩 덧붙이기만 하는 텍스트 기록과 그 위에 얹은 이진 요약 트리(binary merge tree)만으로 에이전트의 영속 기억을 만듭니다. 도구는 의존성 없는 단일 파이썬 파일이고, 에이전트 쪽에 붙는 것은 426개 토큰짜리 프롬프트 한 덩...
[읽을거리&정보공유] [2026/08/24 ~ 30] 이번 주에 살펴볼 만한 AI/ML 논문 모음
@9bow

[2026/08/24 ~ 30] 이번 주에 살펴볼 만한 AI/ML 논문 모음

PyTorchKR🔥🇰🇷 🤔💭

이번 주 선정된 10편의 논문들을 살펴본 결과, 다음과 같은 3가지 공통된 내용을 찾아볼 수 있었습니다:

:one: 단발성 실행을 넘어선 "지속적 지식 축적 및 구조화된 메모리": 이번 주 논문들에서는 AI 에이전트가 1회성 작업을 넘어 장기적이고 복잡한 환경에서 활동하기 위해 기억과 지식을 체계적으로 관리하는 방향이 두드러졌습니다. WikiSkill은 에이전트의 과거 실행 경험을 위키(Wiki) 형태의 영속적 지식 베이스로 축적하여 모델 간 전이가 가능한 스킬로 진화시켰습니다. 또한 Compaction Cliff(Knowledge Triage)는 장기 실행 에이전트의 메모리 압축 과정에서 필수적인 안전 규칙이 유실되는 현상을 막기 위해 정보 유형별로 보존 정책을 분리했으며, Life-Bench는 단순 개념...
[읽을거리&정보공유] SlideOps: 저장소로 만든 슬라이드가 코드와 어긋난 시점을 토큰 없이 찾아내는 에이전트 스킬
@9bow

SlideOps 소개

문서를 쓰는 일은 더 이상 병목이 아닙니다. SlideOps를 만든 Gleb Lukicov는 저장소 하나를 코딩 에이전트에게 넘기면 정확한 온보딩 자료 스무 페이지를 10분 안에 얻을 수 있게 됐다고 말합니다. 문제는 그 다음입니다. 생성된 문서는 만들어진 순간부터 현실과 어긋나기 시작하는데, 파이프라인 어디에도 그 사실을 알려주는 장치가 없습니다. 저자는 이 상황을 "이제 우리는 누구도 읽어낼 수 없는 속도로 자신 있게 틀린 자료를 만들어낼 수 있게 됐다" 라고 적었습니다. 데이터베이스 마이그레이션을 두 번 실행한다고 설명해 둔 덱이, 실제로는 열 번씩 실행하게 된 1년 뒤에도 여전히 두 번이라고 말하고 있는 상황이 그 예입니다.

SlideOps는 생성된 문서를 빌드 산출물(build artifact) 로 취급합니다. 저자는 저장소의 다른 빌드 산출물...
[읽을거리&정보공유] 빌 게이츠가 본 AI 전환기의 세 가지 위험과 대응책: 인간만을 위한 영역(Human Reserved)과 AI 토큰세 제안
@9bow

빌 게이츠가 다시 AI를 이야기하는 이유

빌 게이츠(Bill Gates)가 자신의 블로그 Gates Notes에 AI 전환기를 다룬 긴 글을 올렸습니다. 요지는 한 문장으로 정리됩니다. AI는 지금까지 발명된 것 중 가장 강력한 평등화 장치가 되거나, 아니면 가장 심한 불평등의 원천이 될 텐데 어느 쪽이 될지는 앞으로 몇 년 사이의 선택에 달려 있고, 지금 세계는 그 선택을 준비하고 있지 않다는 것입니다. 글의 부제도 "좋은 쪽이 나쁜 쪽을 넘어서게 하려면 계획이 필요합니다" 로 달려 있습니다.

게이츠는 자신의 시각이 어디에서 왔는지부터 설명합니다. 평생 가진 직업은 둘뿐인데, 하나는 Microsoft에서 사람들에게 힘을 실어 주는 소프트웨어를 만든 일이고, 다른 하나는 2008년부터 전업으로 하고 있는 일,...