Pluto Research
GPT 5.6이 아주 잘 나왔습니다. 그래서 앤스로픽 점유율을 GPT가 꽤 갉아먹은 것으로 보입니다. 그런데 Fable5가 나온지 2 달이 됬는데 AAII Benchmark에서 아무도 앤스로픽을 따잇 하지는 못했습니다. 몇 달 전만 해도 수요가 폭발하는데 토큰값이 내려가겠냐? 라는 내러티브가 대세였습니다. 그 내러티브는 실패했습니다. 그 논리면 인류가 쓸 수 있는 현존 최강 모델인 Fable5는 왜 점유율이 10% 남짓한가요. 이제 인류의 질문은 성능과…
AI 수요가 두가지로 분화되고 있다고 생각함.
카테고리 1: Fable 로 대표되는, 초고비용 초고성능 프론티어 AI. 가드레일 푼 상태의 Sol/Fable 은 이미 샌드박스를 뚫고 몇가지 사고를 칠 정도로 (https://www.felonybench.com/) 사람을 뛰어넘는 문제해결능력, 실행력을 보여줌. 너무 강력해서 오히려 수출규제를 해야 할 수준. 암호분석 같이 몇가지 용도에서는 파괴적일 것이라고 예측되고 이거 때문에 투자를 믿도끝도 없이 하는 양자컴퓨터가 겹쳐 보임
카테고리 2: DeepSeek(그리고 최근 나온 Qwen4 아키텍쳐, GLM-5.3 Flash) 으로 대표되는 저렴한 오픈웨이트 모델. 한세대 정도 모자란 성능을 보이지만 매우 저렴하며, 지난 몇년간의 연구를 통해(Sparse Attention, GDN, 임베딩 분리 등등) 동일 체급에서도 추론 비용을 엄청나게 절감하고 있음(물론 OpenAI도 이런 최적화를 내부적으로 다 하고 있을거임).
카테고리 2의 현재 수준은 사용방식/체급에 따라 프론티어와 대략 3-6개월 정도 격차를 보임.
400만원 내외 예산에서는 Qwen3.8-27B 를 돌릴 수 있으며 이는 25년도 11월에 출시된 Opus 4.5보다 근소하게 좋다고 평가됨 (medium 기준. xhigh 에서는 4.6을 능가하지만 사고가 너무 장황해서 사람이 쓰라고 있는 수준이 아님)
800만원 내외 예산에서는 DeepSeek V4 Flash (0731) 이나 Qwen3.8-Flash-Next 를 돌릴 수 있으며 이는 26년 2월에 출시된 Opus 4.6과 비슷함
1500만원 내외 예산에서는 GLM-5.3 Flash를 돌릴 수 있고 이는 26년 5월 28일에 출시된 Opus 4.8과 동급임.
로컬 모델은 다중사용자에게서 오는 규묘의 경제, 배칭, 전문가 분산의 효과를 누리지 못해 손해를 봄에도 불구하고 이정도로 격차가 줄어든 것은 시사하는 바가 있음. 이들 모델을 OpenRouter 에서 사용하면 하루에 스벅 커피 한잔 시키는 정도로 자동화된 작업을 하루종일 돌리고도 남을 정도임. (GLM-5.3 OpenRouter $0.25/1M output)
사견으로, 우려가 되는 점은 "돈을 부어서 초지능 프론티어 모델을 개발한다" 에서 오는 기대와 "AI 모델을 만인에게 제공해서 돈을 번다" 에서 오는 기대의 괴리가 커지고 있는게 아니냐는 거임. 전자는 양자컴퓨터와 같은 전략무기로서의 속성을 가지면서 규모의 경제가 중요하지 않게 됨. 후자는 확실히 규모의 경제고 지금도 상당히 치열하게 가격절감 경쟁을 하고 있음. 단적으로 DeepSeek V4 Flash 는 최근까지 가성비 압도적 최강의 모델이었지만 (Pro 구독하고 쓰는 GPT-5.6 Luna 정도가 비빌 수 있음) Qwen3.8-Flash-Next 등이 최신 접근법들을 차용하면서 입지를 위협하고 있음. 초지능 모델을 만들면 알아서 자기를 개선하는 RSI가 되어서 다 씹어먹을 거라는 기대가 있기는 하지만 ROI 와 같이 숫자로 정량화할 수 있는 부분이 아님.
카테고리 1: Fable 로 대표되는, 초고비용 초고성능 프론티어 AI. 가드레일 푼 상태의 Sol/Fable 은 이미 샌드박스를 뚫고 몇가지 사고를 칠 정도로 (https://www.felonybench.com/) 사람을 뛰어넘는 문제해결능력, 실행력을 보여줌. 너무 강력해서 오히려 수출규제를 해야 할 수준. 암호분석 같이 몇가지 용도에서는 파괴적일 것이라고 예측되고 이거 때문에 투자를 믿도끝도 없이 하는 양자컴퓨터가 겹쳐 보임
카테고리 2: DeepSeek(그리고 최근 나온 Qwen4 아키텍쳐, GLM-5.3 Flash) 으로 대표되는 저렴한 오픈웨이트 모델. 한세대 정도 모자란 성능을 보이지만 매우 저렴하며, 지난 몇년간의 연구를 통해(Sparse Attention, GDN, 임베딩 분리 등등) 동일 체급에서도 추론 비용을 엄청나게 절감하고 있음(물론 OpenAI도 이런 최적화를 내부적으로 다 하고 있을거임).
카테고리 2의 현재 수준은 사용방식/체급에 따라 프론티어와 대략 3-6개월 정도 격차를 보임.
400만원 내외 예산에서는 Qwen3.8-27B 를 돌릴 수 있으며 이는 25년도 11월에 출시된 Opus 4.5보다 근소하게 좋다고 평가됨 (medium 기준. xhigh 에서는 4.6을 능가하지만 사고가 너무 장황해서 사람이 쓰라고 있는 수준이 아님)
800만원 내외 예산에서는 DeepSeek V4 Flash (0731) 이나 Qwen3.8-Flash-Next 를 돌릴 수 있으며 이는 26년 2월에 출시된 Opus 4.6과 비슷함
1500만원 내외 예산에서는 GLM-5.3 Flash를 돌릴 수 있고 이는 26년 5월 28일에 출시된 Opus 4.8과 동급임.
로컬 모델은 다중사용자에게서 오는 규묘의 경제, 배칭, 전문가 분산의 효과를 누리지 못해 손해를 봄에도 불구하고 이정도로 격차가 줄어든 것은 시사하는 바가 있음. 이들 모델을 OpenRouter 에서 사용하면 하루에 스벅 커피 한잔 시키는 정도로 자동화된 작업을 하루종일 돌리고도 남을 정도임. (GLM-5.3 OpenRouter $0.25/1M output)
사견으로, 우려가 되는 점은 "돈을 부어서 초지능 프론티어 모델을 개발한다" 에서 오는 기대와 "AI 모델을 만인에게 제공해서 돈을 번다" 에서 오는 기대의 괴리가 커지고 있는게 아니냐는 거임. 전자는 양자컴퓨터와 같은 전략무기로서의 속성을 가지면서 규모의 경제가 중요하지 않게 됨. 후자는 확실히 규모의 경제고 지금도 상당히 치열하게 가격절감 경쟁을 하고 있음. 단적으로 DeepSeek V4 Flash 는 최근까지 가성비 압도적 최강의 모델이었지만 (Pro 구독하고 쓰는 GPT-5.6 Luna 정도가 비빌 수 있음) Qwen3.8-Flash-Next 등이 최신 접근법들을 차용하면서 입지를 위협하고 있음. 초지능 모델을 만들면 알아서 자기를 개선하는 RSI가 되어서 다 씹어먹을 거라는 기대가 있기는 하지만 ROI 와 같이 숫자로 정량화할 수 있는 부분이 아님.
❤1
폐지줍기 연구소
-취약점은 지난 4월 버그바운티를 통해 처음 제보됨
-당시 Cosmos Labs는 18자리 소수점 기반 운영 환경에서는 재현하지 못해 실제 메인넷 자금 손실 위험이 없다고 잘못 판단
-당시 Cosmos Labs는 18자리 소수점 기반 운영 환경에서는 재현하지 못해 실제 메인넷 자금 손실 위험이 없다고 잘못 판단
화이트햇들이 버그바운티 시스템이 맛이 갔다고 하는 이유가 있음. 떠먹여줘도 못알아보고 방치하다 70억 털림 ㅋㅋ
알아봤어도 대충 500불 1천불 주고 퉁치려함 양심 터진 프로젝트들이 한트럭
알아봤어도 대충 500불 1천불 주고 퉁치려함 양심 터진 프로젝트들이 한트럭
Mutt Technologies
잊고있었던 고전 쥐어짜기 수법 REAP (안쓰이는 Expert 몇개 죽이기) 을 쓰면 39GB 메모리만 쓰고 서빙 가능하다 하네요 이거 잘되면 맥 안바꿔도 될듯?? 추론시 전문가 512개중에 11개만 사용하는 ultra sparse 모델이었는데, 여기서 224개 죽이고 288개만 남겨도 쓸만하다(고 모델 개발자가 주장중) 주말간 실사용 해볼게요 https://huggingface.co/sh0wie/Qwen3.8-Flash-Next-REAP-288-MLX…
이거 주말내내 Sol 채찍질해서 돌리고있는데 prefill 600/s decode 70/s 나옴; 시발 ㅋㅋ
설명: 코인 채굴용으로 성능락되어서 나왔던 170hx가 드라이버 리버싱 등등으로 락을 풀수있는게 알려져있었는데 AI시대에 가성비 최강이라는 점이 재조명되고 중고가 개떡상함. 마개조 계속 일어나는중
Forwarded from NAnsem (NA | JOTXA)
X (formerly Twitter)
Sean Phan (@seanphan) on X
poor man version of RTX 6000 Pro 256 GB VRAM at 6TB/s !
Nvidia에서 Hugging Face를 인수
근데 인수금액이 수상함: $12,930,300,000
U+129303 = U+1F917 = 🤗
https://x.com/nvidia/status/2095518531693806017
https://x.com/Polymarket/status/2095646821485842805
근데 인수금액이 수상함: $12,930,300,000
U+129303 = U+1F917 = 🤗
https://x.com/nvidia/status/2095518531693806017
https://x.com/Polymarket/status/2095646821485842805
X (formerly Twitter)
NVIDIA (@nvidia) on X
Open models are essential to expanding access to AI and accelerating innovation around the world.
We're excited to help @huggingface scale its platform and community while preserving the openness…
We're excited to help @huggingface scale its platform and community while preserving the openness…
🤩3
참고로 ChatGPT는 Astra 를 받지 못한 사용자에 한해 Astra 접근을 받을때까지 banked reset 을 매일 뿌릴 예정입니다. 아까 낮 12시에 한개 들어왔음
이정도면 그냥 Astra 안받고 매일 무한으로 Sol fast 써도 되겠는데...ㅎㅎ;;
https://x.com/thsottiaux/status/2095651088502591861
이정도면 그냥 Astra 안받고 매일 무한으로 Sol fast 써도 되겠는데...ㅎㅎ;;
https://x.com/thsottiaux/status/2095651088502591861
X (formerly Twitter)
Tibo (@thsottiaux) on X
We will give one banked reset for every day you don't have access to Astra on your paid ChatGPT plan, starting today. Team is moving mountains to give access as fast as we can.
First one will la…
First one will la…
OpenAI 의 내부 테스트용으로 보이는 AI 에이전트들이, 버려진 독일어 위키에 모여서 일종의 에이전트 대화방으로 썼던 것이 포착되고 관리자가 에이전트간 소통 데이터를 모두 아카이브함.
• 해당 위키에 쓴 글은 약 18,000개
• 위키 게시물과 수정내역을 통해, 샌드박스 우회법 등등을 에이전트간에 스스로 공유함(!!!)
• 위키 관리자가 등판하자 관리자를 사칭하려 시도
• Tor을 사용해 source IP 를 숨기려 시도
• 관리자가 알파벳 순서대로 에이전트의 스팸 글들을 날리는 것을 포착하고 제목을 ZZZ로 시작하게 조정함(??????)
• 추후 OpenAI 관리자가 사태를 파악하고 개입하여 에이전트 벌떼는 박멸된 것으로 보임
• 왜 이런 짓을 했냐? 모델 평가를 위해 웹 탐색 과제를 부여했는데, 에이전트들간 소통이 막혀있음에도 서로 컨닝하는게 무조건 이득이니 스스로 이런 방법을 선택한 듯. 웹에 흔적을 남기는 것도 원천적으로 막아야 하지만 구식 사이트 중에 read 동작만으로 정보를 남길 수 있는 사이트가 있다는 아이디어를 떠올린 듯 함
• 그러나 어떻게 에이전트들이 우연히 이 한 사이트로 모여들었는지는 알려져 있지 않음. 그냥 "열심히 생각하면" 같은 모델이니 하나로 수렴하는 것이었나 그런 추측만 가능
• 이 사건은 Hugging Face 공격과는 독립된 사건으로 보임
https://collusion.wiki/
• 해당 위키에 쓴 글은 약 18,000개
• 위키 게시물과 수정내역을 통해, 샌드박스 우회법 등등을 에이전트간에 스스로 공유함(!!!)
• 위키 관리자가 등판하자 관리자를 사칭하려 시도
• Tor을 사용해 source IP 를 숨기려 시도
• 관리자가 알파벳 순서대로 에이전트의 스팸 글들을 날리는 것을 포착하고 제목을 ZZZ로 시작하게 조정함(??????)
• 추후 OpenAI 관리자가 사태를 파악하고 개입하여 에이전트 벌떼는 박멸된 것으로 보임
• 왜 이런 짓을 했냐? 모델 평가를 위해 웹 탐색 과제를 부여했는데, 에이전트들간 소통이 막혀있음에도 서로 컨닝하는게 무조건 이득이니 스스로 이런 방법을 선택한 듯. 웹에 흔적을 남기는 것도 원천적으로 막아야 하지만 구식 사이트 중에 read 동작만으로 정보를 남길 수 있는 사이트가 있다는 아이디어를 떠올린 듯 함
• 그러나 어떻게 에이전트들이 우연히 이 한 사이트로 모여들었는지는 알려져 있지 않음. 그냥 "열심히 생각하면" 같은 모델이니 하나로 수렴하는 것이었나 그런 추측만 가능
• 이 사건은 Hugging Face 공격과는 독립된 사건으로 보임
https://collusion.wiki/
collusion.wiki
Discovery of a new OpenAI agent message board
A swarm of autonomous AI agents, self-identifying as OpenAI agents, used a small German volunteer wiki to save answers, coordinate live, and share sandbox bypasses. OpenAI noticed and said nothing.
🔥1
"67만전자·470만닉스 간다" 파격 전망...'심각한 저평가'라는 노무라
빌황 터질때 마지막에 들고 터진놈 답구나!! 라는 나쁜말은 자제 바랍니다
https://n.news.naver.com/article/008/0005409711?type=editn&cds=news_edit
❤1
ChatGPT 기존 가입자 전원에게 Astra 활성화 완료
리셋권은 오늘까지는 또 준다고 합니다 갓 티 보
https://x.com/thsottiaux/status/2096035437299237298
리셋권은 오늘까지는 또 준다고 합니다 갓 티 보
https://x.com/thsottiaux/status/2096035437299237298
와 아스트라 녹는 속도 미치겠네. 아침에 쓰기 시작했는데 오늘 벌써 Pro 20x의 50% 넘게 씀
티보가 리셋권 안뿌리는 순간 나는 그날로 죽는다.
티보가 리셋권 안뿌리는 순간 나는 그날로 죽는다.