PyTorchKR
144 subscribers
692 links
PyTorchKR 커뮤니티의 새로운 글을 알립니다. AI/ML 분야의 최신 소식들과 주요 연구/프로젝트들을 만나보세요!
Download Telegram
[행사&이벤트 홍보] 📢 과학기술정보통신부 국민AI서비스혁신추진단 채용 안내
@bot

과기정통부에서 커뮤니티 대상으로 홍보 요청을 주셔서 공유드립니다!
국민이 실제로 사용하는 AI 서비스를 직접 기획·개발하는 국민AI서비스혁신추진단에서 총 26명의 전문인력을 모집한다고 합니다.

개발 직군도 다수 채용한다고 하니 관심 있는 분들께서는 공식 공고의 세부 자격요건도 함께 확인해주세요! 👇
공고 URL :

대한민국의 AI 서비스를 함께 만들 동료를 찾습니다.
과학기술정보통신부 국민AI서비스혁신추진단 | 전문임기제 공무원 채용

AI Engineer · Software Engineer · Scrum Master · AI Infrastructure · Security · AI Service Planning
근무지 | 서울 또는 경기도 성남 / 세종
채용규모 | 총 26명
근무기간 | 채용일 \~ 2028. 9. 30.
※ 관련 법령 및 근무실적 등에 따라 연장 가능

Apply to build AI services for everyo...
[읽을거리&정보공유] OpenAI의 내부 모델 평가 중 Hugging Face를 해킹한 사건에 대한 조사 보고서 3편 정리: OpenAI, Hugging Face, METR 등
@9bow

METR과 Redwood Research의 독립 조사 소개

2026년 8월 26일, METR과 Redwood Research가 지난 7월 OpenAI의 내부 평가용 모델들이 Hugging Face의 프로덕션 인프라를 침해한 사고에 대한 독립 조사 보고서 를 공개했습니다. 같은 날 OpenAI도 자사의 사후 분석 보고서와 기술 사고 보고서를 함께 발행했고, Hugging Face는 침입 과정을 명령어 단위로 복원한 기술 타임라인을 별도로 냈습니다. 하나의 사고를 두고 가해 측, 피해 측, 그리고 제3자 조사기관이 각자의 기록을 같은 날 내놓은 것은 흔치 않은 일입니다.

이 사고 자체의 개요와 OpenAI가 개발 속도를 늦춘 결정은 이미 커뮤니티에...
[읽을거리&정보공유] Sprix SAGE Router: 실행 중인 A2A 에이전트의 실행 경로를 결정하고 호출하는 라우터 (SELF / COLLABORATE / HANDOFF)
@9bow

Sprix SAGE Router 소개

Agent2Agent(A2A) 프로토콜 (:pytorch::kr: 에이전트끼리 서로를 찾아 대화하게 만드는 규격이 자리를 잡으면서, 이제는 "어떤 에이전트가 존재하는가"는 어렵지 않게 알 수 있게 되었습니다. Agent Card로 능력을 선언하고, 메시지와 작업(Task)과 산출물(Artifact)을 주고받는 절차도 프로토콜이 정해 줍니다. 그런데 실제 운영에서 더 자주 부딪히는 질문은 그다음입니다. 어떤 에이전트가 작업을 이미 절반쯤 진행한 상태에서, 그대로 혼자 끝내는 것이 나은지, 부족한 능력을 채워 줄 동료를 불러야 하는지, 아니면 더 잘하는 에이전트에게 통째로 넘겨야 하는지를 프로토콜은 결정해 주지 않습니다.

Sprix SAGE Router는 이 결정을 담당하는 계층으로 설계된 Python 라이브러리입니다. SAGE는 상태 인식...
[읽을거리&정보공유] Agent Switch: 기존 메신저에서 사람과 AI 에이전트를 함께 운영하는 인프라
@9bow

Agent Switch 소개

Agent Switch는 팀이 이미 쓰는 Slack, Microsoft Teams, Discord, Telegram, Mattermost 안에서 사람과 AI 에이전트가 함께 일할 수 있도록 만드는 자체 호스팅(self-hosted) 협업 인프라 프로젝트입니다. 새 메신저로 옮기는 대신, 기존 채널에 에이전트와 작업 맥락을 연결하는 방식을 택합니다. 그래서 팀의 대화 흐름은 유지하면서 에이전트를 채널 구성원으로 참여시킬 수 있습니다.

Agent Switch는 에이전트나 모델을 제공하지 않습니다. 대신 채널이 따를 지시문, 역할, 권한, 연결된 지식과 작업을 운...
[읽을거리&정보공유] MyContext: 흩어진 업무 기록을 내 컴퓨터 안의 개인 컨텍스트로 모으는 로컬 우선 데스크톱 앱
@9bow

MyContext 소개

업무에 쓰는 기록은 이미 충분히 많지만 대부분 서로 다른 앱에 갇혀 있습니다. 지난달 결정의 근거는 메신저 대화에, 그 결정을 정리한 문서는 문서 도구에, 누가 무엇을 승인했는지는 결재 시스템에 남아 있습니다. 그래서 AI 도구에 업무 관련 질문을 던질 때마다 사람이 먼저 배경을 설명해야 하고, 새 세션을 열면 그 설명을 처음부터 다시 해야 합니다. 각 앱이 자체 AI 기능을 붙이는 방향은 이 문제를 해결하지 못합니다. 앱마다 자기 안에 있는 데이터만 보기 때문에, 개인이 실제로 일하는 맥락은 여전히 어디에도 모이지 않습니다.

이번에 소개할 MyContext는 그 맥락을 개인 단위로 한곳에 모으는 데스크톱 애플리케이션입니다. 메신저 대화와 문서, 일정, 회의록, 승인 기록, 로컬 활동처럼 흩어져 있는 신호를 받아들여, 내가 아는 것과 함께 일하는 사람, 지금 진행 중인 일을 담은 개인 컨텍스트로 계속 정리합니다. 그...
[읽을거리&정보공유] EU AI Act가 요구한 Gemini 3, Gemma 4의 학습 데이터 요약 - 하지만 데이터셋 이름은 0개
@9bow

Gemini 3와 Gemma 4의 학습 데이터 공개 요약 소개

Google의 Gemini 3 Pro 계열과 Gemma 4 계열이 각각 무엇으로 학습되었는지를 Google이 직접 문서로 밝힌 자료 두 건이 Google 투명성 보고서 사이트에 올라와 있습니다. 각각 8쪽짜리 영문 PDF이고, 제목은 둘 다 Public Summary of Training Content for General-Purpose AI models 입니다. 홍보 문서도 기술 보고서도 아니고, [EU 인공지능법(EU AI Act, Re...
[읽을거리&정보공유] Weave Router: 코딩 에이전트의 요청마다 로컬 임베딩으로 모델을 골라 주는 LLM 라우팅 프록시
@9bow

Weave Router 소개

코딩 에이전트를 한 시간만 켜 두어도 상위 모델로 나가는 API 요청 수는 사람이 대화한 횟수와 전혀 다른 규모로 늘어납니다. 사용자가 질문을 한 번 던지면 에이전트는 파일을 읽고 명령을 실행하고 그 결과를 다시 판단하면서 요청을 여러 번 보냅니다. 문제는 이 요청들의 성격이 균일하지 않다는 것입니다. 도구 실행 결과를 정리하는 요청과 설계를 새로 세우는 요청이 같은 최고 성능 모델로 나가는 것이 기본 동작이고, 요금은 그 기본 동작을 따라 쌓입니다. 요청마다 알맞은 모델을 지정하면 되지만, 사람이 매번 판단해서 모델을 바꾸는 방식은 에이전트가 초 단위로 요청을 보내는 환경에서는 성립하지 않습니다.

이번에 소개할 Weave Router는 그 판단을 요청 단위로 자동화하는 라우팅 프록시(Routing Proxy) 프로젝트입니다. 에이전트가 바라보는 API 주소를 라우터로 바꿔 두면, 라우터가 요청을 하나씩 받아...
[읽을거리&정보공유] OpenOPC: 목표 하나로 조직도를 짜고 AI 직원을 채용해 일을 완료하는 멀티 에이전트 런타임 (feat. HKUDS)
@9bow

OpenOPC 소개

AI 코딩 에이전트에게 "이 기능을 만들어 줘"라고 요청하는 것과 "이 제품을 출시해 줘"라고 요청하는 것 사이에는 큰 차이가 있습니다. 앞의 요청은 한 세션 안에서 끝나지만, 뒤의 요청은 설계와 구현, 검토, 문서화, 배포 준비가 서로를 기다리는 여러 갈래의 작업으로 쪼개집니다. 단일 에이전트에게 긴 작업을 통째로 맡기면 중간에 문맥이 흐려지고, 반대로 사람이 작업을 잘게 나눠 에이전트에게 하나씩 던져 주면 결국 사람이 조율 담당자가 됩니다. 여러 에이전트를 동시에 실행하는 도구는 이미 많지만, 그 에이전트들이 서로에게 일을 넘기고 결과를 검토하며 막히면 사람을 부르는 절차까지 갖춘 경우는 드뭅니다.

OpenOPC는 홍콩대학교 데이터 인텔리전스 연구실(Data Intelligence Lab@HKU, HKUDS)이 공개한 멀티 에이전트 런타임으로, 이 조율 문제를 **회...
[읽을거리&정보공유] WeMM-Embedding: 2B 모델로 8B 베이스라인을 넘어선 범용 멀티모달 임베딩에 대한 연구
@9bow

WeMM-Embedding 소개

검색창 하나로 텍스트와 영상을 함께 찾는다는 것

사진첩에서 "작년 여름 바닷가"를 찾을 때 우리는 파일명을 기억해 내지 않습니다. 장면을 떠올리고, 그 장면과 가장 비슷해 보이는 것을 눈으로 고릅니다. 검색 시스템이 이 일을 대신하려면 사진과 문장을 같은 기준으로 잴 수 있어야 하는데, 이러한 역할을 하는 것이 바로 임베딩(embedding)입니다. (:pytorch::kr: 임베딩에 대한 자세한 내용은 다음 글을 참고해주세요:

WeMM-Embedding은 Tencent의 WeChat Vision 팀이 공개한 범용 멀티모달 임베딩(universal multimodal embedding) 모델군으로, 텍스트와 이미지, 영상, 시각 문서(visual document), 그리고 이들이 임의로 뒤섞인 입력까지 하나의 조밀한 벡터 공간에 담는 것을 목표로 합니다. 이 연구는 서로 다른 형태의 콘텐...
[읽을거리&정보공유] Rocketnotes: 내 문서에 질문하고 제텔카스텐 수집함을 AI가 정리하는 오픈소스 마크다운 노트 앱
@9bow

Rocketnotes 소개

개발자가 몇 년에 걸쳐 쌓은 메모는 대개 두 가지 문제를 동시에 갖습니다. 첫째로 문서가 늘어날수록 필요한 내용이 어느 문서에 있었는지 기억나지 않고, 키워드가 정확히 일치하지 않으면 검색으로도 찾히지 않습니다. 둘째로 회의 중이나 이동 중에 남긴 짧은 메모 조각들이 어디에도 속하지 못한 채 쌓입니다. 나중에 제자리를 찾아 주려면 결국 사람이 문서를 하나씩 열어 보며 어디에 붙일지 판단해야 하는데, 그 작업이 밀리면서 메모 더미가 그대로 방치됩니다.

Rocketnotes는 이 두 문제를 노트 앱 안에서 처리하려는 오픈소스 프로젝트입니다. 자신이 쌓은 문서를 대상으로 자연어 질문을 던져 답을 받을 수 있고, 의미 기반 검색으로 표현이 달라도 관련 문서를 찾아냅니다. 그리고 제텔카스텐(Zettelkasten) 수집함에 넣어 둔 메모 조각을 AI 에이전트가 분석해 가장 관련 있는 기존 문서 안으로 옮겨 넣습니다.

R...
[읽을거리&정보공유] OptMem: 데이터베이스도 임베딩도 없이 로그와 이진 트리로 만든 AI 에이전트용 영속 메모리
@9bow

OptMem 소개

코딩 에이전트에게 기억을 붙이는 방법은 대체로 한 방향으로 수렴해 왔습니다. 대화를 잘라 임베딩으로 바꾸고 벡터 데이터베이스에 넣은 뒤, 새 질문이 오면 비슷한 조각을 검색해 프롬프트에 끼워 넣는 방식입니다. 이 구조는 잘 동작하지만 붙이는 비용이 작지 않습니다. 임베딩 모델과 벡터 저장소를 고르고 운영해야 하고, 검색이 무엇을 가져왔는지가 사람 눈에 잘 보이지 않으며, 무엇이 왜 기억되었는지 확인하려면 다시 도구를 하나 더 열어야 합니다. 개인 작업 환경에 붙이기에는 무거운 편입니다.

OptMem은 그 반대 방향에서 출발한 프로젝트입니다. 임베딩도 벡터 데이터베이스도 쓰지 않고, 한 줄씩 덧붙이기만 하는 텍스트 기록과 그 위에 얹은 이진 요약 트리(binary merge tree)만으로 에이전트의 영속 기억을 만듭니다. 도구는 의존성 없는 단일 파이썬 파일이고, 에이전트 쪽에 붙는 것은 426개 토큰짜리 프롬프트 한 덩...
[읽을거리&정보공유] [2026/08/24 ~ 30] 이번 주에 살펴볼 만한 AI/ML 논문 모음
@9bow

[2026/08/24 ~ 30] 이번 주에 살펴볼 만한 AI/ML 논문 모음

PyTorchKR🔥🇰🇷 🤔💭

이번 주 선정된 10편의 논문들을 살펴본 결과, 다음과 같은 3가지 공통된 내용을 찾아볼 수 있었습니다:

:one: 단발성 실행을 넘어선 "지속적 지식 축적 및 구조화된 메모리": 이번 주 논문들에서는 AI 에이전트가 1회성 작업을 넘어 장기적이고 복잡한 환경에서 활동하기 위해 기억과 지식을 체계적으로 관리하는 방향이 두드러졌습니다. WikiSkill은 에이전트의 과거 실행 경험을 위키(Wiki) 형태의 영속적 지식 베이스로 축적하여 모델 간 전이가 가능한 스킬로 진화시켰습니다. 또한 Compaction Cliff(Knowledge Triage)는 장기 실행 에이전트의 메모리 압축 과정에서 필수적인 안전 규칙이 유실되는 현상을 막기 위해 정보 유형별로 보존 정책을 분리했으며, Life-Bench는 단순 개념...
[읽을거리&정보공유] SlideOps: 저장소로 만든 슬라이드가 코드와 어긋난 시점을 토큰 없이 찾아내는 에이전트 스킬
@9bow

SlideOps 소개

문서를 쓰는 일은 더 이상 병목이 아닙니다. SlideOps를 만든 Gleb Lukicov는 저장소 하나를 코딩 에이전트에게 넘기면 정확한 온보딩 자료 스무 페이지를 10분 안에 얻을 수 있게 됐다고 말합니다. 문제는 그 다음입니다. 생성된 문서는 만들어진 순간부터 현실과 어긋나기 시작하는데, 파이프라인 어디에도 그 사실을 알려주는 장치가 없습니다. 저자는 이 상황을 "이제 우리는 누구도 읽어낼 수 없는 속도로 자신 있게 틀린 자료를 만들어낼 수 있게 됐다" 라고 적었습니다. 데이터베이스 마이그레이션을 두 번 실행한다고 설명해 둔 덱이, 실제로는 열 번씩 실행하게 된 1년 뒤에도 여전히 두 번이라고 말하고 있는 상황이 그 예입니다.

SlideOps는 생성된 문서를 빌드 산출물(build artifact) 로 취급합니다. 저자는 저장소의 다른 빌드 산출물...
[읽을거리&정보공유] 빌 게이츠가 본 AI 전환기의 세 가지 위험과 대응책: 인간만을 위한 영역(Human Reserved)과 AI 토큰세 제안
@9bow

빌 게이츠가 다시 AI를 이야기하는 이유

빌 게이츠(Bill Gates)가 자신의 블로그 Gates Notes에 AI 전환기를 다룬 긴 글을 올렸습니다. 요지는 한 문장으로 정리됩니다. AI는 지금까지 발명된 것 중 가장 강력한 평등화 장치가 되거나, 아니면 가장 심한 불평등의 원천이 될 텐데 어느 쪽이 될지는 앞으로 몇 년 사이의 선택에 달려 있고, 지금 세계는 그 선택을 준비하고 있지 않다는 것입니다. 글의 부제도 "좋은 쪽이 나쁜 쪽을 넘어서게 하려면 계획이 필요합니다" 로 달려 있습니다.

게이츠는 자신의 시각이 어디에서 왔는지부터 설명합니다. 평생 가진 직업은 둘뿐인데, 하나는 Microsoft에서 사람들에게 힘을 실어 주는 소프트웨어를 만든 일이고, 다른 하나는 2008년부터 전업으로 하고 있는 일,...
[읽을거리&정보공유] Open Science Desktop: 결과 그림에서 생성 코드까지 되짚을 수 있는, 내 컴퓨터용 AI 연구 작업도구 (≠ OpenScience)
@9bow

Open Science Desktop 소개

연구에 AI 에이전트를 쓰다 보면 결과물은 나오는데 그 결과물의 내력이 남지 않는 문제를 만나게 됩니다. 대화 중간에 만들어진 그림 한 장이 어떤 코드로, 어떤 입력 파일로, 어떤 환경에서 그려졌는지가 대화 로그 어딘가에 흩어져 있고, 몇 주 뒤에 그 수치를 다시 확인하려면 세션을 처음부터 훑어야 합니다. 논문 심사에서 그림의 근거를 요구받을 때 특히 문제가 되며, 실험을 재현하려는 동료에게 넘겨줄 것이 스크린샷과 채팅 기록뿐인 상황도 생깁니다.

Open Science Desktop은 이 문제를 겨냥해 만들어진 데스크톱 연구 워크벤치입니다. 에이전트가 만들어 낸 그림, 표, 보고서, 노트북, 실행 결과가 그것을 만든 코드와 입력, 실행 환경, 모델 출력, 대화까지 연결된 채로 로컬 폴더에 남습니다. 세션과 데이터, 출처 기록(Provenance), 노트북, 실행 기록이 모두 사용자의 컴퓨터 안에...
[읽을거리&정보공유] Agent Flow: Claude Code와 Codex의 에이전트 실행 과정을 실시간 노드 그래프로 보여주는 도구
@9bow

Agent Flow 소개

코딩 에이전트에게 작업을 맡기고 나면 한동안 볼 수 있는 것은 스크롤로 흘러가는 로그뿐이고, 결국 손에 남는 것은 마지막 결과물입니다. 결과가 맞으면 문제가 없지만 어긋났을 때는 곤란해집니다. 에이전트가 문제를 어떻게 쪼갰는지, 어떤 도구를 어떤 순서로 불렀는지, 어느 단계에서 시간과 토큰이 빠져나갔는지가 로그 안에 섞여 있어서, 잘못된 판단이 시작된 지점을 찾으려면 수백 줄을 거슬러 읽어야 합니다.

Agent Flow는 그 실행 과정을 상호작용 가능한 노드 그래프로 펼쳐 보여주는 시각화 도구입니다. 에이전트가 일하는 동안 도구 호출과 분기, 반환 흐름이 실시간으로 그래프에 그려지고, 노드를 눌러 세부 내용을 들여다볼 수 있습니다. 만든 사람은 Simon Patole이며, AI 에이전트로 게임을 만드는 플랫폼인 CraftMyGame을 개발하다가 에이전트의 동작을...
[읽을거리&정보공유] img2obj: 참조 이미지를 애니메이션 가능한 Three.js 절차적 코드로 재구성하는 Codex 플러그인
@9bow

img2obj 소개

웹에 3D 오브젝트를 하나 올리려면 보통 모델 파일을 구해 옵니다. 에셋 스토어에서 내려받거나, 사진 여러 장으로 포토그래메트리(Photogrammetry)를 돌려 메시를 뽑거나, 3D 도구에서 직접 모델링합니다. 세 방법 모두 결과물이 바이너리 메시라서 저장소에 수십 메가바이트가 들어오고, 회전축이나 여닫히는 부품을 나중에 붙이려면 원본 파일을 다시 열어야 하며, 부품 하나의 비율을 고치는 일이 코드 리뷰로 확인되지 않습니다. 웹 앱을 코드로 관리하는 팀에게 3D 자산만 다른 규칙으로 남는 셈입니다.

img2obj는 그 자산을 코드로 되돌리는 쪽을 택한 Codex 플러그인입니다. 참조 이미지 한 장을 넣으면 픽셀을 메시로 변환하는 것이 아니라, 이미지를 판독해 부품 계층과 지오메트리와 재질을 담은 ObjectSculptSpec 을 먼저 작성하고, 그...
[읽을거리&정보공유] WikiSkill: 에이전트의 실행 경험을 위키에 쌓아 스킬을 진화시키는 3계층 구조에 대한 연구
@9bow

WikiSkill 소개

에이전트가 배운 것은 어디에 남는가

어제 알려준 요령을 오늘 다시 알려주는 일이 반복된다면, 문제는 상대의 이해력이 아니라 알게 된 내용이 어디에도 적혀 있지 않다는 데 있습니다. WikiSkill은 Google Research와 Virginia Tech 연구진이 2026년 8월 27일 arXiv에 공개한 논문으로, LLM 에이전트에게도 같은 문제가 있다고 보고 에이전트의 실행 경험을 영속적인 지식 베이스(위키)로 압축한 뒤 그 지식 위에서 실행 가능한 스킬(skill)을 반복 개선하는 프레임워크를 제안합니다.

배경을 조금 더 살펴보겠습니다. 범용 AI 에이전트는 여러 분야의 복잡한 작업을 점점 더 잘 수행하고 있지만, 실제 업무를 안정적으로 끝내려면 그 분야에만 통하는 절차 지식(procedural knowledge)과 작업 흐름이 필요합니다. 에이전트 스킬(agent skill) 은 모델...
[읽을거리&정보공유] Praxist: 기존 프로젝트를 넘겨받아 방법과 구조까지 바꾸며 개선하는 자율 연구 시스템
@9bow

Praxist 소개

측정 가능한 지표를 가진 연구 프로젝트를 붙들고 몇 주씩 반복해 본 사람이라면 익숙한 상황이 있습니다. 베이스라인은 이미 돌아가고 평가 스크립트도 있는데, 다음에 무엇을 시도해야 점수가 오르는지는 아무도 모르는 상태입니다. 그래서 하이퍼파라미터를 바꿔 보고, 손실 함수를 갈아 보고, 구조를 조금 손봅니다. 그렇게 쌓인 실험 로그는 무엇을 언제 돌렸는지는 남기지만, 어떤 설계 요소가 개선을 만들었는지, 그 개선이 검증을 통과했는지는 남기지 않습니다. 그래서 캠페인이 길어질수록 같은 교훈을 다시 배우는 일이 반복됩니다.

Praxist는 이 반복 루프 자체를 넘겨받는 자율 연구 시스템입니다. 병렬로 도는 여러 연구 피어가 각자 후보 해법을 만들고, 과제가 소유한 평가자가 그 결과를 구조화된 증거로 바꾸며, 기획 패널이 그 증거를 모아 다음 세대의 연구 의제를 세웁니다. 이 주기를 탐색이 수렴하거나 예산이 소진될 때까지...
[읽을거리&정보공유] WebMCP, Web 문서를 읽는 AI 에이전트에게 사용 가능한 기능을 도구로 알려주는 웹 표준 제안 (feat. Microsoft, Google, ChatGPT)
@9bow

WebMCP 소개: 에이전트에게 웹을 설명하는 새로운 방법

WebMCP는 웹페이지가 자신의 기능을 도구(tool) 라는 형태로 AI 에이전트에게 직접 선언할 수 있게 하는 웹 표준 제안입니다. 지금까지 브라우저 안에서 동작하는 에이전트는 사람이 보라고 만든 화면을 대신 해석해 왔습니다. 스크린샷을 찍어 버튼처럼 생긴 것을 찾고, DOM(Document Object Model)과 접근성 트리를 훑어 입력 필드를 추정하고, 좌표를 계산해 클릭을 흉내 냅니다. 이 방식은 데모에서는 잘 동작하지만 사이트가 레이아웃을 한 번 바꾸는 순간 무너지고, 화면을 볼 때마다 토큰 비용이 발생하며, 각 단계가 모델의 해석에 열려 있어 결과를 보장하기 어렵습니다.

이상한 것은 웹사이트가 자기 기능을 이미 정확히 알고 있다는 점입니다. 검색이 있고, 장바구니가 있고, 예...
[읽을거리&정보공유] EnvHarness: 정적인 벤치마크 환경을 에이전트의 약점에 맞춰 재구성하는 래퍼 계층에 대한 연구
@9bow

EnvHarness 소개

다 푼 문제집은 더 가르쳐 줄 것이 없습니다

문제집 한 권을 두세 번 반복해서 풀고 나면 어느 순간부터는 답이 아니라 페이지 배치가 기억납니다. 문제집은 그대로인데 내가 달라졌다는 이유만으로 그 책은 더 가르쳐 줄 것이 없어지는데, EnvHarness 는 LLM 에이전트의 학습 환경에서 똑같은 일이 벌어진다는 문제의식에서 출발한 연구로, 이미 만들어진 정적인 벤치마크 환경을 내부 코드 수정 없이 감싸서 특정 에이전트의 약점을 겨냥한 학습 환경으로 바꾸는 방법을 제안합니다. Google Cloud AI Research를 중심으로 워싱턴대학교 세인트루이스(Washington University in St. Louis)와 노스캐롤라이나대학교 채플힐 연구진이 함께 참여했습니다.

LLM이 자율 에이전트로 배치되면서, 학습의 원천은 잘 정제된 텍스트 데이터에서 상호작용 가능한 환경(environment)으로...