Mutt Technologies
1.42K subscribers
220 photos
1 file
252 links
돈 이야기 안해요 (아마도)
English speakers might want https://x.com/haxxton1
Download Telegram
딥시크 엔지니어의 최근 포스트

- 앤쓰로픽은 히틀러다
- 특정회사가 최첨단 ai를 꼭쥐고 지들 맘대로 독점하는 세상은 사펑2077같은 디스토피아일거다
- 딥시크는 ai를 싸고, 똑똑하게 만들어서 다 뿌린다
- 진정한 ai 유토피아는 ai 공산주의로만 실현될수 있고, 그게 내가 딥시크에 남는 이유다.
- 나도 내가 지금 하는 일(커널최적화)는 올해 여름이 마지막이라고 생각한다 (이제 ai가 더 잘하니까)
- 난 혁명의 대상이다. 피할수없다면 내가 직접 혁명하겠다.

https://mp.weixin.qq.com/s/zk0KxuLzhmMJ4LPYW_OHMA
무온적 사고 - AI, 명상, 밈
딥시크 엔지니어의 최근 포스트 - 앤쓰로픽은 히틀러다 - 특정회사가 최첨단 ai를 꼭쥐고 지들 맘대로 독점하는 세상은 사펑2077같은 디스토피아일거다 - 딥시크는 ai를 싸고, 똑똑하게 만들어서 다 뿌린다 - 진정한 ai 유토피아는 ai 공산주의로만 실현될수 있고, 그게 내가 딥시크에 남는 이유다. - 나도 내가 지금 하는 일(커널최적화)는 올해 여름이 마지막이라고 생각한다 (이제 ai가 더 잘하니까) - 난 혁명의 대상이다. 피할수없다면 내가 직접 혁명하겠다.…
AI가 끊임없이 발전하는 가운데, 나는 몇 가지 문제에 대해 우려를 표하고 싶다.

• 학생들이 AI를 이용해 숙제를 끝낼 것을 더 선호하게 되는 것은 아닐까? 특히 실무에 가까운 각종 Lab은? 만약 앞에 두 가지 선택지가 있다고 상상해보자. 하나는 고생스럽게 8시간을 들여 Lab을 끝내는 것 — 어쩌면 만점을 받지 못할지도 모른다. 다른 하나는 AI 모델을 실행하여, 몇 천원짜리 비용, 몇 분의 시간에, 바로 AI에게 만점 코드를 작성하게 하는 것이다. 대부분의 학생은 어느 쪽을 선택하겠는가?
• 위의 한 가지는, 대량의 학생의 공학(engineering) 능력이 심각하게 부족해지게 만든다. 여기에는 코드를 조직하는 능력, build system을 만드는 능력, 미래의 잠재적 요구를 생각하고 설계 단계에서 미리 대응하는 능력, 추상화하는 능력 등이 포함된다. 그렇다면, AI 능력이 계속 강해지는 배경 아래, 이 "공학 능력"은 여전히 필수적인 것인가? 이 공학 능력은 과거의 "x86 어셈블리를 능숙하게 작성하는" 능력처럼 시대에 점차 버림받게 될까, 아니면 "소프트웨어에서 시스템, 그리고 하드웨어까지 이르는 컴퓨터 시스템 전체를 이해하는" 능력처럼 영원한 가치를 지닐까? 후자라면, 그것이 위험하다 — 공학 능력이 매우 나쁜 사람이, AI와 결합하면, "slop"을 뽑아내는 효율이 과거의 몇 배에 달할 수 있고, 이로 인해 시스템에 각종 불행을 심어, 세상을 한층 더 엉성하게 만들어 버릴 수 있다.
• 미래 사회에서, 권력은 기술이나 지능보다 더 중요해질 것인가?

이러한 문제들은, 어쩌면 시대 스스로가 답할 수밖에 없을 것이다.
제가 집에서 돌릴 수 있는 모델중에 중국어를 제일 잘할거같은 Qwen 3.8 27B에게 번역 시켰습니다. 가끔 기습중국어 섞어서 손으로 빼는것만 했는데 잘하네요
Jito 디스코드에서 알림 4개 떠있길래 켜보니까 관리자 계정 탈취당했는지 쌩뚱맞은 봇이 공지로 스캠 클레임 사이트 가서 토큰 받아가라고 전체멘션 스팸 날리고 있음

잘하는 짓거리다
놀랍게도 Qwen3 0.6B는 동급크기 임베더 SoTA다(embedding model이 뭔지는 검색 ㄱ)

텍스트 생성모델이 아니라 검색용 벡터 추출모델이라 공산당 사상 주입이 될 가능성은 매우 희박
미국 정부에서도 검색용 AI로 중국산 Qwen 증류모델을 사용하고 있네요 ㅋㅋㅋㅋㅋ

https://www.federalregister.gov/documents/search#advanced
샤오미가 MiMo 학습과정을 그냥 공개 대시보드로 깜. MiMo-v2.6 학습에 지금까지 $1.3M 썼네요 . 초당 거의 10불씩 녹는중

물론 시크릿소스를 주는건 아니고 현직자 아니면 궁금할법한 "이정도 모델 학습시키려면 시간이랑 돈 얼마나 박아야 하지?" 에 대해서 알려주는 중인듯

https://mimo.xiaomi.com/rl/
상위 모델들 SWE-Bench 벤치마크는 치팅에 상당히 의존하며 성공률도 유의미하게 높음. GPT-5.6 Terra의 경우 90%에서 치팅 시도하고 2/3은 성공함...

벤치를 치팅이 일어나지 않도록 잘 방어하거나, 아모데이가 그렇게 부르짖는 alignment를 근본적으로 수정할 필요가 있어보임

https://www.vals.ai/blogs/cheating-on-the-rise
>>방금, Gemini 4 Pro가 유출되어 공개 테스트에 등장! Astra와 Fable을 압도
(중국언론)

•구글이 플래그십 모델 Gemini 4 Pro를 ‘gemini-3.8-flash’라는 이름으로 위장해 AI 아레나에 조용히 테스트용으로 공개한 것으로 보임. 벤치마크 결과 코딩, 에이전트, 추론 등 여러 능력에서 OpenAI의 Astra와 Anthropic의 Fable 5.1을 전면적으로 앞선 것으로 나타났으며, ‘현존 최강’으로 평가할 만한 수준임. 실제 테스트에서도 4 Pro는 UI 디자인, SVG/3D 생성 및 게임 개발 등에서 뛰어난 성능을 보였음. 구글이 이미 RSI(재귀적 자기개선) 폐쇄 루프를 구현해 Gemini 4의 사전학습을 앞당겨 완료했다는 이야기도 나옴

>刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable https://wallstreetcn.com/articles/3782055#from=ios
❤1
기계학습 탑티어 컨퍼런스 ICLR이 2027년도 제출물 수가 이전(2013-2026) 모든 제출물 수보다도 많아졌다고 발표......

https://x.com/denny_zhou/status/2101474965405253708
Mutt Technologies
샤오미가 MiMo 학습과정을 그냥 공개 대시보드로 깜. MiMo-v2.6 학습에 지금까지 $1.3M 썼네요 . 초당 거의 10불씩 녹는중 물론 시크릿소스를 주는건 아니고 현직자 아니면 궁금할법한 "이정도 모델 학습시키려면 시간이랑 돈 얼마나 박아야 하지?" 에 대해서 알려주는 중인듯 https://mimo.xiaomi.com/rl/
60억 태우고 MiMo-V2.6 학습 완료, Pro 기준 AAII 46 (Sol이 47)

코딩에이전트 벤치마크 결과가 거의 Fable 수준인데 치팅한거 아닌가...? 의심갈 정도로 결과가 좋음

일단 자기들 주장에 따르면 강화학습 환경을 공격적으로 최적화해서 엄청나게 스케일아웃 했다는 듯.

특이한 점으로는 Astra처럼 computer use 능력이 엄청나게 강화됨. 그사이에 아이디어 보고 LLM 으로 RL환경을 잘 구현했나봄

https://mimo.xiaomi.com/mimo-v2-6

그리고 당연하게 Day-1에 가중치 공개. https://huggingface.co/collections/XiaomiMiMo/mimo-v26
OpenAI: GPT-6-Sol/Luna 출시. 이전세대 동급과 비슷하거나 더 좋은 가격에 절반 가격
Anthropic: Opus 5.5 출시, Astra보다 우수한 computer use 및 Opus 5보다 소폭 인하된 가격. Fable 5.1보다 일부 벤치마크 상회

별들의 전쟁이네 진짜...

https://openai.com/index/introducing-gpt-6-sol-and-luna/
https://www.anthropic.com/claude-opus-5-5
워뇨띠 형님이 거래기록 공유해주셨다길래 시뮬레이션 기반으로 맞짱뜨는 게임 만들었어요 해보실분?

해킹아니에요 지갑연결 없어요

https://aoa.asdf.zone/
❤1
솔라나 차세대 컨센서스 알고리즘 Alpenglow 가 테스트넷에서 시범운전할거라네요
제가 이더리움 싫어하는건 아니고 솔라나도 딱히 안좋아하는데 이렇게 빠르게 실험적인 기술 적용하는 태도는 상당히 큰 엣지인듯

https://x.com/anza_xyz/status/2102402573479084114
Scale AI Labs에서 SWE-Bench Pro 후속 벤치마크 Pro V2를 발표했는데, 이미 공개된 모델들로 평가하니 1등이 99.4점(100점 만점)
벤치마크를 내자마자 포화되는 세상 (그리고 유독 개선이 안 되는 벤치마크들은 까 보면 문제가 잘못된 경우가 수두룩)

https://x.com/ScaleAILabs/status/2102450569185292730
❤1
Mutt Technologies
워뇨띠 형님이 거래기록 공유해주셨다길래 시뮬레이션 기반으로 맞짱뜨는 게임 만들었어요 해보실분? 해킹아니에요 지갑연결 없어요 https://aoa.asdf.zone/
매매를 정말 잘하시는 분이 등장하셨는데 상금 지급을 위해 집주소와 혈액형 및 지병 여부를 DM 보내주세요!

치팅하지 마라 뒤진다
오늘 올라온 기와체인이 러그 짭기와체인이 맞다는 가정하에: 거기서 사용했던 지갑은 나중에 기와체인 나와도 안쓰는걸 추천

체인ID가 같아서 낚였다 뭐 이런말도 도는데, 체인ID는 다른 EVM 체인 간에 서명을 재사용하는걸 막기 위해서(replay attack) 인위적으로 트랜잭션 내용을 다르게 만들기 위해 추가한 요소지, 특정 체인의 유효성을 보장하는 장치가 아닙니다. Nonce와 비슷한데 nonce는 한 체인 안에서 트랜잭션 내용 겹침을 막는거고 chain ID는 다른 체인간에 겹침을 막는거라 생각하시면 정확함

오히려 이번 사건에서 해당 chainID로 트랜잭션을 서명해서 RPC에 보낸 이상, 나중에 실제 기와체인이 동일한 체인ID로 나오면 해당 서명을 들고있던 사기꾼이 기와체인에 동일하게 제출해서 (진짜) 기와체인 ETH를 뜯어가는 공격이 가능해짐

이걸 막을 수 있는 방법:
• 해당 지갑을 버린다(최소한 기와체인용으로는 쓰지 않는다)
• 기와체인이 열리자마자 Nonce값을 마구 올려서(빈 트랜잭션 보내서) 짭기와체인에서 보냈던 트랜잭션의 nonce들을 전부 무효화한다
• 업비트가 기와체인 런칭할때 chain ID를 바꾼다 (해주면 좋겠지만 걔네들 마음...)
• 짭기와체인 사기꾼들이 귀찮아서/멍청해서/착해서 트랜잭션 내용을 안쓰고 버리길 기도한다
👍2😱1