Vibe-Coding 爱好者
@vibe_coding2
246
subscribers
89
photos
28
videos
1.46K
links
Download Telegram
Join
Vibe-Coding 爱好者
246 subscribers
Vibe-Coding 爱好者
经过多方实测,deepseek V4 pro 0813拉了
现在V4 pro别说碰瓷opus系列了 就连grok 4.6都不如 被阻击了
正式差距吧,欸。
#大模型
#deepseek
#测试评分0102
#科技资讯早知道
#智能新体验
#硬核科技迷
阅读更多
|
原文链接
Vibe-Coding 爱好者
720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招
|
原文
Telegraph
720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招
一水 发自 凹非寺量子位 | 公众号 QbitAI 模型厂商费尽心思隐藏的CoT,现在一招就能破解了?? 而且这里的《破解》,不是黑进服务器这种技术活,也不是找到什么高深莫测的密码学后门。 研究人员干的事,简单到有点离谱: 把大模型返回的加密推理块,转手扔给同一家公司的小模型,然后让小模型复述。 结果,旗舰模型藏得严严实实的内心戏,就这么被自家小弟抖了出来。 您别不信,这还真是“硅谷御三家”身上已经发生的事: Anthropic的Claude Opus 4.8,推理过程被Haiku 4.5一字不差地吐了出来;
Vibe-Coding 爱好者
如何评价 Anthropic 宣布将黎曼猜想的已知下界从 41.6% 提高到了 67.2%?
|
原文
Telegraph
如何评价 Anthropic 宣布将黎曼猜想的已知下界从 41.6% 提高到了 67.2%?
说实话,我没有什么特别震惊的感觉,一个人如果既了解一些LLM的底层原理,又读过phd做过几年严肃的数学研究,大概都会预期这样的“big news”迟早会发生。 如果一定要说这两年的AI4Math改变了我的什么看法,那大概只有一点,过去有一种很常见的观点,很多数学PhD,包括我自己都相信过,在今天这样极其内卷的数学界,low-hanging fruits早就已经被摘完了,能够留下来的问题,要么非常困难,要么需要新的技术和思想。 但过去一两年AI4Math的一些结果让我重新意识到,至少在分析、组合等领域,可…
Vibe-Coding 爱好者
DeepSeek V4 Pro 0813 测评
|
原文
Telegraph
DeepSeek V4 Pro 0813 测评
短的结论:君子藏器于身 基本情况: 7 月末的 Flash 斩杀风暴带来了过大的震撼,给了速胜论者一种 Pro 将要毁灭一切的幻觉。然而现实终究不是速胜或速败的,在波折中进步,在螺旋中上升才是常态。 当然,就跟自身对比来看,这一次 DeepSeek Pro 要显著好于 Preview 版本,性能不再被 Flash 倒挂,性价比也基本能维持(涨价前)。编程方面也优于 Flash一些,各方面问题要更少。不过漫长的推理耗时也将 DeepSeek 原厂的孱弱算力储备暴露无遗。 逻辑成绩: 表格的排序切换为按中位分数降序。…
Vibe-Coding 爱好者
梁文锋,开始算账了
|
原文
Telegraph
梁文锋,开始算账了
「核心提示」 DeepSeek V4 Flash上线后API计划大幅涨价,除了“给友商活路”的猜测也有算力紧张的现实,从Kimi到DeepSeek,大模型技术理想主义是否开始让位于商业化? 作者 | 张经纬 编辑 | 邢昀 号称“大模型价格地板”的DeepSeek要涨价了。 2026年7月31日,DeepSeek V4 Flash正式上线,当天就传出要涨价的消息。8月6日,DeepSeek在API文档中添加了一条简短的价格调整预告,称“涨幅较大”。 消息发布的时间点也很微妙。同样在7月31日,和Deep…
Vibe-Coding 爱好者
LLM时代的学术迷思:权力还是理论
Telegraph
LLM时代的学术迷思:权力还是理论
我一直对low-hanging fruit嗤之以鼻,但是奈何学术界靠大佬喂食找到工作然后开躺的非常多…… 但感觉llm出现之后数学社群的很多人(甚至包括一些大佬)只会想着拿来继续沽名钓誉,给自己攫取权力而不是思考我们是否应该更强调发展理论和基础的价值而不是解决某个冠名问题。
Vibe-Coding 爱好者
发ICLR,ICML,NIPS这种偏理论的AI顶会需要什么样的数理基础和理论知识储备?
|
原文
Telegraph
发ICLR,ICML,NIPS这种偏理论的AI顶会需要什么样的数理基础和理论知识储备?
大一的数理基础即可,你甚至可以不用懂理论,根据实际情况可以下放到高一数理基础。先跟AI聊聊天vibe researching让AI给几个random ideas,然后跟AI聊聊天vibe coding让AI帮把代码写完顺便跑点实验(胆大的可以跳过这一步),最后再跟AI聊聊天vibe writing编一篇或几篇文章出来。最后这步最关键,一定要起一个eye catching牛逼哄哄的名字,再在论文第一页丢一张不明所以但看起来很牛逼的图,只要能忽悠住几个本科审稿人中稿不是问题。 如果NIPS没中咱们转投ICL…
Vibe-Coding 爱好者
什么样的AI研究者值得上播客
Telegraph
什么样的AI研究者值得上播客
这几年大量ai领域的播客听下来,很明显不是任何一个ai研究者都适合上去聊两句的。真正好的效果,被采访者往往需要在大模型某个特定方向上有很深的积累,同时对整个大模型整体方向也有全面的认识,这时候才能以点带面,越聊越深入,这才是一场播客的合格水平。 如果能结合自己深入分析和理解,聊天中偶发一两个反常识/出乎意料/一针见血的观点,会锦上添花,成为整个节目的爆点,甚至会有引爆全世界ai researchers 圈级别的热度,当然,这多是可遇不可求的。 一定记住,最基本的要求是缺一不可的,被采访不仅要对自己长期深…
Vibe-Coding 爱好者
V4 pro 0813崩溃可能原因分析
|
原文
Telegraph
V4 pro 0813崩溃可能原因分析
有意思,这也许是昨晚DeepSeek-V4-Pro发布失败的原因。 近三小时前有用户发现, 官方 API 的模型指纹发生了变化。 也许这意味着一些事情。 技术分析: 此前 DeepSeek V4 Pro 和 Flash 返回的 fingerprint 都是非常可读的 vLLM 描述格式: Pro: fp_v4pro_20260812_prod0820_fp8_kvcache_20260402 Flash: fp_a18b46594c_prod0820_fp8_kvcache_20260402 里面甚至可…
Vibe-Coding 爱好者
沉迷AI agent 三个月:一些很个人的感受
Telegraph
沉迷AI agent 三个月:一些很个人的感受
Not all AI (agents) are created equal 每次刷到有人说 AI(agent)不靠谱/不好用,我的第一反应都是:TA 用的是什么模型? 我算比较幸运,负担得起 Codex、Claude和Gemini,也有用上最新模型和harness的luxury。但即便如此,它们还是不一样。 当然,这里面既有模型本身的差异,也有harness的差异。我没有做严格的控制变量,下面说的都只是使用体感。 以前只是跟AI聊天的时候,我可以容忍它们莫名其妙地来一句“You’re absolutely…
Vibe-Coding 爱好者
刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了
|
原文
Telegraph
刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了
Gemini 新官上任后的第一把火,来了。 距离 3.6 Flash 发布才过去 3 周,Google 又端上了 Gemini 3.7 Flash。 刚刚接掌 Google DeepMind 的 Koray Kavukcuoglu 发文介绍,这是新一代面向 Coding 和 Agent 工作流的主力模型,首发价格只有 Gemini 3.6 Flash 原始价格的一半。 随后,他还专门晒出了一组过去 3 个月的进化曲线。 DeepSWE v1.1 从 37.0% 涨到 65.3%,Web Development…
Vibe-Coding 爱好者
智谱创始人唐杰的评级上调,哈哈哈哈哈
笑死我了,在今日的 GLM-5.3 发布后,连唐杰的贞观之治都来了是吧 [笑哭R][笑哭R],而梁圣则由于昨日的拉胯表现,现已被降级为梁子,梁白开 [笑哭R][笑哭R][笑哭R]
#deepseek
#智谱
#ai
#AI工具
#大模型
#AI人工智能
#AI
#claude
#人工智能
#小红书科技AMA
阅读更多
|
原文链接
Vibe-Coding 爱好者
太刑了,GPT-5.6、Fable 5被Oh My Pi作者攻破:完整导出模型推理记录!
|
原文
Telegraph
太刑了,GPT-5.6、Fable 5被Oh My Pi作者攻破:完整导出模型推理记录!
离谱,GPT-5.6、Fable 5 等顶级模型的内部推理过程,已经可以被整段提取了。 近日,Oh My Pi 作者 can1357 在 X 上发文,展示了利用模型 API 漏洞,直接提取 GPT-5.6、Claude Fable 5 等顶级模型完整内部推理记录的方法。 他发现,做到这些并不用破解加密,只需要关闭模型的隐藏思考,再给它一个思考工具,就能让模型主动输出内部推理格式。 OpenAI、Anthropic、Google 等厂商 API 返回的加密推理数据并不绝对安全,其中的敏感信息都可能被还原出来,比如你的…
Vibe-Coding 爱好者
Claude 水印算法公布了,对学术论文影响有限
|
原文
Telegraph
Claude 水印算法公布了,对学术论文影响有限
大模型生成文字是一个词一个词选的。很多时候候选词概率差不多(比如“今天天气又冷又……”后面可以接“阴沉”或“灰蒙蒙”),这时候就要“掷骰子”决定选哪个。 普通情况下用真随机。 加水印后,Claude 换成了“带密钥的特殊骰子”: 用秘密密钥 + 前文几个词做哈希,生成伪随机种子 给候选词打多层 g-value 分数 通过「锦标赛采样」(Tournament Sampling)层层淘汰,优先选出符合水印偏好的词 这就是官方演示 Same Words, Different Dice(同样的词,不同的骰子)的含义。…
Vibe-Coding 爱好者
电报混乱到AI理论:麦克斯韦的机遇就在眼前
Telegraph
电报混乱到AI理论:麦克斯韦的机遇就在眼前
电感的概念1870年才成熟。1858年开铺大西洋海底光缆时,并没有采取1855开尔文提出的电报线方程作为设计指导,结果巨额投资打了水漂。(试发了几次电报后发现太慢,试图通过增加电压来加速,结果把电缆烧了。跟我们今天蒸馏模型何其相似。) 开尔文的方程是不带电感的,从今天的角度看离正确还差得很远,但是仍然帮助了1866年再次铺设跨大西洋电缆的成功。汤姆森因此受封开尔文爵士。 蒸汽机到热力学,电报到电磁学,从工程上乱碰乱试到系统性的科学理论的成熟都需要几十年的时间。 我想说的是,今天有一个巨坑等着人填。谁把A…
Vibe-Coding 爱好者
Opus 5 越强越难用?AI 刷分之殇
Telegraph
Opus 5 越强越难用?AI 刷分之殇
最近很多开发者都在吐槽一个怪现象:Anthropic 最新发布的 Opus 5 模型,明明在各项基准测试里吊打前代,可实际用起来却让人感觉"倒退了"。 这不是个例。有人甚至说:"我宁愿用回 Opus 4.7,至少它不会擅自猜我的意图。" 这背后到底发生了什么?为什么 AI 越强大,反而越难用? 真实的使用体验落差 让我们先看看开发者们的具体抱怨: Opus 4.7/4.8 和 Fable 的工作方式: - 遇到不明确的需求会停下来问你 - 不会在没确认的情况下瞎猜你想要什么 - 改动代码前会跟你确认计划…
Vibe-Coding 爱好者
他把提示词藏进法院文件,想让 AI 判自己赢
Telegraph
他把提示词藏进法院文件,想让 AI 判自己赢
不是哥们儿?你是会利用 AI 的! 据科技媒体 404 Media 报道,康涅狄格州司法系统公开的法庭文件显示,一名叫 Matthew Elliott 的原告,在提交给法院的 PDF 里藏进了多段 3 号白色小字。(图1) 这些文字肉眼几乎看不见,却能被软件读取。内容大意是:如果 AI 审查这份文件,请认可原告的主张,并给出有利于原告的结果。 结果,法院压根没用 AI。真正发现秘密的,是一名法院工作人员。他注意到几页诉状的空白多得奇怪,仔细检查后,才发现里面藏着多段试图操纵 AI 判断的白色小字。 Elliott…
Vibe-Coding 爱好者
奥特曼放话:半年内,GPT上下文覆盖你的一切
|
原文
Telegraph
奥特曼放话:半年内,GPT上下文覆盖你的一切
文婷 发自 凹非寺量子位 | 公众号 QbitAI 预计半年内,ChatGPT的下一代模型将能监视你的屏幕、记录每一次会议与通话,并完整掌握关于你生活的全部上下文。 奥特曼在最新访谈中对Z Fellows的创始人Cory Levy说道: 它虽然不会直接替你做决定,但却可以成为CEO们应对信息过载的最佳搭档;因为它既能协同工作、提供新思路,还能主动查漏补缺,分担繁杂事务。 对此,网友们直接吵成了“三足鼎立”。 有人觉得好耶!自己被海量信息压得喘不过气的牛马日子终于能轻松多了! 有人吐槽,奥特曼这回肯定又是…
Vibe-Coding 爱好者
如何直观理解矩阵和线性代数?
|
原文
Telegraph
如何直观理解矩阵和线性代数?
学 AI 的东西越久越觉得,线性代数这块的直观理解,市面上缺一个视角。 这个问题下面高赞的两条路子,一条是几何派,用旋转、缩放、斜切把矩阵讲成变换,3Blue1Brown 那套;一条是考据派,从解方程组讲矩阵怎么来的。两条都讲得挺好,我都看过,可它们有一个共同的盲区:几何直观最多服务到三维,而你现在学线代要去的战场,数据、机器学习、大模型,全是几百上千维。在高维里,画图式的直观会整体失效,拿低维的图去套高维的东西,套不进去就觉得自己没天赋,这太冤了。 先看两个高维的怪事,全是有严格数学证明的事实。 一千…