苏格拉底式对话能否击穿AI的“胡说八道”
在人工智能生成内容呈指数级增长、且常与事实相去甚远的当下,伦敦政治经济学院教授桑迪·佩珀指出,苏格拉底式对话这一古老的教学法,可以成为批判性审视和评估AI内容的有效工具。佩珀在撰写新书《公司为何存在?——一个商业伦理问题》时,借鉴柏拉图《高尔吉亚篇》的对话形式,虚构了苏格拉底与经济学家米尔顿·弗里德曼的辩论,探讨企业的真正目的究竟是服务社会还是仅仅为股东赚钱。他认为,通过提出“企业存在的目的是治病救人还是利润最大化?”等层层深入的追问,苏格拉底式对话能够帮助人们辨别AI生成内容中的逻辑谬误与虚假信息,抵御所谓“AI胡说”的侵蚀。 #AI #苏格拉底对话 #批判性思维 #商业伦理 #科技伦理 #虚假信息 #深度学习 #哲学
在人工智能生成内容呈指数级增长、且常与事实相去甚远的当下,伦敦政治经济学院教授桑迪·佩珀指出,苏格拉底式对话这一古老的教学法,可以成为批判性审视和评估AI内容的有效工具。佩珀在撰写新书《公司为何存在?——一个商业伦理问题》时,借鉴柏拉图《高尔吉亚篇》的对话形式,虚构了苏格拉底与经济学家米尔顿·弗里德曼的辩论,探讨企业的真正目的究竟是服务社会还是仅仅为股东赚钱。他认为,通过提出“企业存在的目的是治病救人还是利润最大化?”等层层深入的追问,苏格拉底式对话能够帮助人们辨别AI生成内容中的逻辑谬误与虚假信息,抵御所谓“AI胡说”的侵蚀。 #AI #苏格拉底对话 #批判性思维 #商业伦理 #科技伦理 #虚假信息 #深度学习 #哲学
AI安全扫描器对智能体技能判定一致性差,64%案例结论相悖
一项针对AI智能体技能安全扫描器的研究揭示,五款主流扫描器对3084个技能的评估结果高度不一致,在64%的案例中得出截然不同的结论。例如,同一段调用外部API传输AWS配置的代码,一个扫描器标记为“安全”,另一个却判定为“严重风险”。扫描器之间甚至无法就“安全”的定义达成共识,而用户只能依赖一个不可靠的绿色勾选标志。研究背景是AI技能市场存在严重安全隐患:OpenClaw市场曾被恶意技能充斥,高峰期七个最热门技能中有五个为恶意软件,八分之一的技能存在严重问题,而扫描器作为防护措施却形同虚设。用户安装AI技能本质上是一种信任冒险,但当前的安全保障体系已无法支撑这种信任。 #AI安全 #智能体 #扫描器 #网络安全 #信任危机 #恶意软件 #研究
一项针对AI智能体技能安全扫描器的研究揭示,五款主流扫描器对3084个技能的评估结果高度不一致,在64%的案例中得出截然不同的结论。例如,同一段调用外部API传输AWS配置的代码,一个扫描器标记为“安全”,另一个却判定为“严重风险”。扫描器之间甚至无法就“安全”的定义达成共识,而用户只能依赖一个不可靠的绿色勾选标志。研究背景是AI技能市场存在严重安全隐患:OpenClaw市场曾被恶意技能充斥,高峰期七个最热门技能中有五个为恶意软件,八分之一的技能存在严重问题,而扫描器作为防护措施却形同虚设。用户安装AI技能本质上是一种信任冒险,但当前的安全保障体系已无法支撑这种信任。 #AI安全 #智能体 #扫描器 #网络安全 #信任危机 #恶意软件 #研究
代理团队宣言
一份面向软件开发团队的宣言提出,应围绕AI代理重新组织工程团队,将人类判断与AI代理相结合,以提升软件交付价值。宣言强调,衡量标准应从输出量转向实际用户价值,代码数量不等于价值,团队应以结果为导向。核心原则包括:上下文比工具更重要,需要投资于使组织知识可被机器读取;人类应专注于指导、审查和决策,将生产委托给AI代理;摒弃固定仪式,根据审查能力而非生产能力规划,实现持续交付;打破团队壁垒,设计跨团队协作,让人和代理流向工作所在。宣言还指出,代码已变得廉价,判断力才是稀缺资源,团队应围绕审查、验证和决策组织,而非生产。同时,必须避免AI浪费,如过度生产、审查瓶颈、上下文丢失等,并建立问责制,确保代理可追溯、有归属。这些原则旨在应对AI时代的工程组织变革。 #AI #工程团队 #软件开发 #代理 #宣言 #组织变革 #持续交付 #上下文管理
一份面向软件开发团队的宣言提出,应围绕AI代理重新组织工程团队,将人类判断与AI代理相结合,以提升软件交付价值。宣言强调,衡量标准应从输出量转向实际用户价值,代码数量不等于价值,团队应以结果为导向。核心原则包括:上下文比工具更重要,需要投资于使组织知识可被机器读取;人类应专注于指导、审查和决策,将生产委托给AI代理;摒弃固定仪式,根据审查能力而非生产能力规划,实现持续交付;打破团队壁垒,设计跨团队协作,让人和代理流向工作所在。宣言还指出,代码已变得廉价,判断力才是稀缺资源,团队应围绕审查、验证和决策组织,而非生产。同时,必须避免AI浪费,如过度生产、审查瓶颈、上下文丢失等,并建立问责制,确保代理可追溯、有归属。这些原则旨在应对AI时代的工程组织变革。 #AI #工程团队 #软件开发 #代理 #宣言 #组织变革 #持续交付 #上下文管理
奇异学习理论
神经网络本不应奏效。直觉上,拥有数十亿或数万亿参数的神经网络不应具备泛化能力,它们会灾难性地过拟合训练数据。然而,深度神经网络在各种任务中展现了惊人的泛化能力。解释这一现象最清晰的数学理论被称为奇异学习理论(SLT),它未来可能成为AI安全与可解释性的关键数学工具。SLT是什么?它解决了什么问题?又与冰有何关联?神经网络无法用适用于线性回归或逻辑回归等经典模型的统计工具分析,原因在于它们存在退化性。在经典模型中,损失函数处处有曲率,Fisher信息矩阵满秩;而神经网络中,某些神经元的输出权重可能为零,层内神经元的顺序不影响模型,参数微小变化可能不改变损失,这使得模型成为奇异模型。SLT由渡边澄夫发展,它提供了分析参数空间与函数表示非一一对应模型的数学机制。核心结果λ(实对数规范阈值)替代了经典模型中的d/2作为复杂度度量,它衡量参数空间在最小损失附近的体积。低局部学习系数(LLC)意味着参数点周围可自由移动而不显著增加损失,高LLC则相反。 #奇异学习理论 #神经网络 #AI安全 #深度学习 #数学理论 #泛化能力
神经网络本不应奏效。直觉上,拥有数十亿或数万亿参数的神经网络不应具备泛化能力,它们会灾难性地过拟合训练数据。然而,深度神经网络在各种任务中展现了惊人的泛化能力。解释这一现象最清晰的数学理论被称为奇异学习理论(SLT),它未来可能成为AI安全与可解释性的关键数学工具。SLT是什么?它解决了什么问题?又与冰有何关联?神经网络无法用适用于线性回归或逻辑回归等经典模型的统计工具分析,原因在于它们存在退化性。在经典模型中,损失函数处处有曲率,Fisher信息矩阵满秩;而神经网络中,某些神经元的输出权重可能为零,层内神经元的顺序不影响模型,参数微小变化可能不改变损失,这使得模型成为奇异模型。SLT由渡边澄夫发展,它提供了分析参数空间与函数表示非一一对应模型的数学机制。核心结果λ(实对数规范阈值)替代了经典模型中的d/2作为复杂度度量,它衡量参数空间在最小损失附近的体积。低局部学习系数(LLC)意味着参数点周围可自由移动而不显著增加损失,高LLC则相反。 #奇异学习理论 #神经网络 #AI安全 #深度学习 #数学理论 #泛化能力
Anthropic 被曝限制 Fable 开发竞品,CLARITY Act 通过概率降至六成
据深潮 TechFlow 报道,人工智能公司 Anthropic 被指控故意限制其投资方 Fable 开发竞争性产品,此举引发业内对商业道德与市场垄断的讨论。同时,旨在规范 AI 领域的 CLARITY Act(清晰法案)本月在美国国会通过的概率已从此前预测下降至六成,反映出立法进程面临阻力。两则消息叠加,凸显 AI 行业在快速发展中面临的合规与竞争挑战。 #Anthropic #Fable #CLARITYAct #AI监管 #科技新闻 #行业竞争
据深潮 TechFlow 报道,人工智能公司 Anthropic 被指控故意限制其投资方 Fable 开发竞争性产品,此举引发业内对商业道德与市场垄断的讨论。同时,旨在规范 AI 领域的 CLARITY Act(清晰法案)本月在美国国会通过的概率已从此前预测下降至六成,反映出立法进程面临阻力。两则消息叠加,凸显 AI 行业在快速发展中面临的合规与竞争挑战。 #Anthropic #Fable #CLARITYAct #AI监管 #科技新闻 #行业竞争
PDF解析的双层架构
在RAG流程中,解析器承担着关键任务——像人类一样理解文档本质。PDF文档包含两层信息:文档层信号(元数据、原生书签、声明属性)和页面层内容(每页具体内容)。解析器按此顺序读取,当两者冲突时以内容为准。元数据可在毫秒级获取,包括生产者、创建者、加密标志等,用于快速路由判断。但元数据可能被篡改,如Ghostscript和qpdf重压缩时会覆盖上游生产者字段。通过创建者和生产者字段可推断文档来源,从而选择最佳解析策略。生产者可分为五类,从易到难:办公创作工具、PDF生成器、扫描软件等。文章使用PyMuPDF库直接读取PDF字节,无需外部工具或API密钥,对原生PDF解析快速准确。当页面复杂度超出PyMuPDF能力时,可通过自适应级联调用更强大的引擎。 #PDF解析 #RAG #文档处理 #PyMuPDF #元数据 #信息提取 #技术架构
在RAG流程中,解析器承担着关键任务——像人类一样理解文档本质。PDF文档包含两层信息:文档层信号(元数据、原生书签、声明属性)和页面层内容(每页具体内容)。解析器按此顺序读取,当两者冲突时以内容为准。元数据可在毫秒级获取,包括生产者、创建者、加密标志等,用于快速路由判断。但元数据可能被篡改,如Ghostscript和qpdf重压缩时会覆盖上游生产者字段。通过创建者和生产者字段可推断文档来源,从而选择最佳解析策略。生产者可分为五类,从易到难:办公创作工具、PDF生成器、扫描软件等。文章使用PyMuPDF库直接读取PDF字节,无需外部工具或API密钥,对原生PDF解析快速准确。当页面复杂度超出PyMuPDF能力时,可通过自适应级联调用更强大的引擎。 #PDF解析 #RAG #文档处理 #PyMuPDF #元数据 #信息提取 #技术架构
Claude Fable 5 登顶 AI 智能指数排行榜
Anthropic 公司于 6 月 10 日发布 Claude Fable 5 模型,该模型在 Artificial Analysis 智能指数中以 64.9 分位居榜首,领先第二名 GPT-5.5 近 5 分。该模型在 10 项基准测试中的 5 项取得最高分,尤其在 AA-Omniscience 知识测试中得分 40,比前代领先者 Gemini 3.1 Pro Preview 高出 7 分。Claude Fable 5 在代理能力方面表现突出,其 GDPval-AA 工作任务的 Elo 评分达 1932,大幅超越前代 Opus 4.8。在人类最后考试中,该模型得分 53%,领先第二名 7 个百分点,但 9% 的任务会触发安全护栏并回退至 Opus 4.8。模型定价为每百万输入/输出代币 10/50 美元,是 Opus 4.8 的两倍,并保留 100 万代币的上下文窗口。该模型目前包含在 Pro、Max 等订阅计划中,6 月 23 日后将转为积分制使用。 #ClaudeFable5 #Anthropic #AI #大模型 #人工智能 #科技新闻 #智能指数
Anthropic 公司于 6 月 10 日发布 Claude Fable 5 模型,该模型在 Artificial Analysis 智能指数中以 64.9 分位居榜首,领先第二名 GPT-5.5 近 5 分。该模型在 10 项基准测试中的 5 项取得最高分,尤其在 AA-Omniscience 知识测试中得分 40,比前代领先者 Gemini 3.1 Pro Preview 高出 7 分。Claude Fable 5 在代理能力方面表现突出,其 GDPval-AA 工作任务的 Elo 评分达 1932,大幅超越前代 Opus 4.8。在人类最后考试中,该模型得分 53%,领先第二名 7 个百分点,但 9% 的任务会触发安全护栏并回退至 Opus 4.8。模型定价为每百万输入/输出代币 10/50 美元,是 Opus 4.8 的两倍,并保留 100 万代币的上下文窗口。该模型目前包含在 Pro、Max 等订阅计划中,6 月 23 日后将转为积分制使用。 #ClaudeFable5 #Anthropic #AI #大模型 #人工智能 #科技新闻 #智能指数
Apache Burr:构建可靠AI代理与应用的轻量级Python框架
Apache Burr(孵化中)是一个纯Python框架,旨在简化从简单聊天机器人到复杂多代理系统的决策型应用开发。它提供简洁强大的Python API、内置的可观测性UI、状态持久化与恢复、人工介入机制、分支并行执行以及测试重放能力。开发者通过定义“动作”和“状态转换”即可构建应用,无需学习复杂的DSL或YAML。Burr支持与OpenAI、Anthropic、LangChain、Streamlit等主流工具和框架无缝集成,降低开发门槛。该框架强调透明、可调试和可测试,帮助工程师构建可靠的AI驱动系统。 #ApacheBurr #AI框架 #Python #多代理系统 #状态管理 #可观测性 #开源
Apache Burr(孵化中)是一个纯Python框架,旨在简化从简单聊天机器人到复杂多代理系统的决策型应用开发。它提供简洁强大的Python API、内置的可观测性UI、状态持久化与恢复、人工介入机制、分支并行执行以及测试重放能力。开发者通过定义“动作”和“状态转换”即可构建应用,无需学习复杂的DSL或YAML。Burr支持与OpenAI、Anthropic、LangChain、Streamlit等主流工具和框架无缝集成,降低开发门槛。该框架强调透明、可调试和可测试,帮助工程师构建可靠的AI驱动系统。 #ApacheBurr #AI框架 #Python #多代理系统 #状态管理 #可观测性 #开源
Hindsight 成为增长最快的开源 AI 记忆项目
Hindsight 是一款具备学习能力的智能体记忆系统,现已成为开源领域增长最快的智能体记忆项目。其开发者通过 GitHub 星标数据分析,并得到两家独立第三方机构的验证,证实了这一结论。为避免星标数据被刷的干扰,研究采用了星标速度(总星数除以项目存在时间)和同龄期对比两种方法。结果显示,Hindsight 在 222 天内的星标数达到 1.6 倍于同期第二快的 Letta,2.3 倍于 Mem0。尽管 Mem0 最终获得 5.7 万星标,但在 Hindsight 当前年龄时仅不到 7000 星。Hindsight 在前四个月表现低调,随后在 120 至 222 天期间实现爆发式增长,成为同类项目中通过真实采用获得的最大早期峰值。 #开源 #AI #智能体 #记忆项目 #Hindsight #GitHub #技术趋势
Hindsight 是一款具备学习能力的智能体记忆系统,现已成为开源领域增长最快的智能体记忆项目。其开发者通过 GitHub 星标数据分析,并得到两家独立第三方机构的验证,证实了这一结论。为避免星标数据被刷的干扰,研究采用了星标速度(总星数除以项目存在时间)和同龄期对比两种方法。结果显示,Hindsight 在 222 天内的星标数达到 1.6 倍于同期第二快的 Letta,2.3 倍于 Mem0。尽管 Mem0 最终获得 5.7 万星标,但在 Hindsight 当前年龄时仅不到 7000 星。Hindsight 在前四个月表现低调,随后在 120 至 222 天期间实现爆发式增长,成为同类项目中通过真实采用获得的最大早期峰值。 #开源 #AI #智能体 #记忆项目 #Hindsight #GitHub #技术趋势
Apple Watch Series 11 降至历史最低价,watchOS 27 将引入 Siri AI
苹果即将推出的 watchOS 27 系统更新将为 Apple Watch Series 9 及更新机型带来 Siri AI 等新功能。若正考虑升级,最新款 GPS 版 42mm Apple Watch Series 11 所有配色均在亚马逊、沃尔玛和塔吉特以 299 美元(优惠 100 美元)出售,与历史最低价持平。此外,还可通过 Woot 以 14.99 美元起(优惠 35 美元)选购打折表带,自由搭配外观。 #苹果 #AppleWatch #智能手表 #降价 #数码产品 #watchOS #SiriAI #科技新闻
苹果即将推出的 watchOS 27 系统更新将为 Apple Watch Series 9 及更新机型带来 Siri AI 等新功能。若正考虑升级,最新款 GPS 版 42mm Apple Watch Series 11 所有配色均在亚马逊、沃尔玛和塔吉特以 299 美元(优惠 100 美元)出售,与历史最低价持平。此外,还可通过 Woot 以 14.99 美元起(优惠 35 美元)选购打折表带,自由搭配外观。 #苹果 #AppleWatch #智能手表 #降价 #数码产品 #watchOS #SiriAI #科技新闻