GLM-5.2 幻觉率远低于 GPT
最新AI模型评测显示,开源模型GLM-5.2(753B参数,约40B活跃)在人工智能分析智能指数上仅落后GPT-5.5和Fable 5分别4分和9分,而后者保守估计参数规模达1-2万亿。更值得关注的是,在AA-Omniscience幻觉基准测试中,GLM-5.2的幻觉率仅为28%,远低于GPT-5.5的86%和DeepSeek V4 Pro的94%。测试表明,超大规模模型虽然基准分数更高,但倾向于自信地编造答案而非承认知识盲区。例如,面对一个存在技术矛盾的Python编程问题,GLM-5.2仅用12秒就识别出任务不可能性,而DeepSeek V4 Pro消耗近10倍推理时间后仍给出错误答案。这一现象引发业界对单纯扩大参数规模路线的质疑,尤其是在Claude Fable 5因安全漏洞被美国政府限制后,模型的可信度与安全性正成为比绝对性能更关键的指标。 #AI #大模型 #幻觉率 #开源模型 #GLM #GPT #DeepSeek #科技新闻
最新AI模型评测显示,开源模型GLM-5.2(753B参数,约40B活跃)在人工智能分析智能指数上仅落后GPT-5.5和Fable 5分别4分和9分,而后者保守估计参数规模达1-2万亿。更值得关注的是,在AA-Omniscience幻觉基准测试中,GLM-5.2的幻觉率仅为28%,远低于GPT-5.5的86%和DeepSeek V4 Pro的94%。测试表明,超大规模模型虽然基准分数更高,但倾向于自信地编造答案而非承认知识盲区。例如,面对一个存在技术矛盾的Python编程问题,GLM-5.2仅用12秒就识别出任务不可能性,而DeepSeek V4 Pro消耗近10倍推理时间后仍给出错误答案。这一现象引发业界对单纯扩大参数规模路线的质疑,尤其是在Claude Fable 5因安全漏洞被美国政府限制后,模型的可信度与安全性正成为比绝对性能更关键的指标。 #AI #大模型 #幻觉率 #开源模型 #GLM #GPT #DeepSeek #科技新闻
TikTok 新用户推荐内容近六成为AI生成低质内容
一项最新研究发现,TikTok为新用户推荐的内容中,高达59%为AI生成的“垃圾内容”。研究团队分析了新用户“为你推荐”页面中的前500条视频,发现其中294条属于AI生成的低质量内容。这些内容主要集中在科学教育、健康和历史等类别,其中科学教育类AI内容占比达35%,健康和历史类分别占33.8%和33.5%。相比之下,健身、音乐和时尚类视频几乎完全由人类创作。研究人员警告,AI生成的虚假教育内容正在污染平台,与权威信息来源竞争。特别令人担忧的是,面向儿童的#cartoonkids标签几乎完全被AI内容占据,而#babytok标签中也有十分之一为AI生成内容。专家指出,这种大规模针对儿童的AI错误信息对大脑发育构成严重风险,但仅有51%的家长使用平板电脑家长控制功能,47%使用智能手机控制功能。 #TikTok #AI内容 #社交媒体 #虚假信息 #儿童保护 #数字素养 #科技新闻 #内容审核
一项最新研究发现,TikTok为新用户推荐的内容中,高达59%为AI生成的“垃圾内容”。研究团队分析了新用户“为你推荐”页面中的前500条视频,发现其中294条属于AI生成的低质量内容。这些内容主要集中在科学教育、健康和历史等类别,其中科学教育类AI内容占比达35%,健康和历史类分别占33.8%和33.5%。相比之下,健身、音乐和时尚类视频几乎完全由人类创作。研究人员警告,AI生成的虚假教育内容正在污染平台,与权威信息来源竞争。特别令人担忧的是,面向儿童的#cartoonkids标签几乎完全被AI内容占据,而#babytok标签中也有十分之一为AI生成内容。专家指出,这种大规模针对儿童的AI错误信息对大脑发育构成严重风险,但仅有51%的家长使用平板电脑家长控制功能,47%使用智能手机控制功能。 #TikTok #AI内容 #社交媒体 #虚假信息 #儿童保护 #数字素养 #科技新闻 #内容审核
Meta 强制工程师制造 AI 训练数据,被指收效甚微
2026 年春季,Meta 将约 6500 名工程师和产品经理强制调入新部门 ADO,专为 AI 模型生产训练数据,包括编程题、测试题及代码评分。员工称工作“消磨灵魂”,内部称之为“古拉格”。技术层面,合成数据在模型需要超越自身来源时失效,前沿代码和智能体任务仍需人工创作。Zuckerberg 认为自家工程师智力高于外包,故采取强制而非招聘。然而,作者预测该部门将流失约 30% 人员,且 Meta 在 AI 前沿追赶有限,下一款旗舰模型预计 2027 年中才发布,数据生成引擎仍需持续运转。尽管 Meta 承诺不裁员,但内部转岗空间有限,该策略难以推动 AI 实质性进步。 #Meta #AI训练数据 #强制劳动 #人工智能 #工程师 #科技新闻 #数据天花板 #前沿模型
2026 年春季,Meta 将约 6500 名工程师和产品经理强制调入新部门 ADO,专为 AI 模型生产训练数据,包括编程题、测试题及代码评分。员工称工作“消磨灵魂”,内部称之为“古拉格”。技术层面,合成数据在模型需要超越自身来源时失效,前沿代码和智能体任务仍需人工创作。Zuckerberg 认为自家工程师智力高于外包,故采取强制而非招聘。然而,作者预测该部门将流失约 30% 人员,且 Meta 在 AI 前沿追赶有限,下一款旗舰模型预计 2027 年中才发布,数据生成引擎仍需持续运转。尽管 Meta 承诺不裁员,但内部转岗空间有限,该策略难以推动 AI 实质性进步。 #Meta #AI训练数据 #强制劳动 #人工智能 #工程师 #科技新闻 #数据天花板 #前沿模型
人工生命四十年
2003年,进化生物学家理查德·伦斯基与合作者通过名为Avida的软件进行实验,观察复杂特征能否从简单步骤逐步演化。虚拟环境中,小程序通过不完美复制和竞争处理器时间,发现逻辑操作EQU仅在环境奖励其构建步骤时才会演化,直接奖励EQU本身则无法实现。这一发现揭示了自适应系统需要环境对中间步骤的奖励才能找到复杂行为。该研究属于人工生命领域,长期游离于主流计算机科学和AI之外。十年后,语言模型实验室遭遇相同原理,却几乎未提及该领域三十年的积累。人工生命的起源可追溯至1970年代末,汤姆·雷在哈佛读研时受MIT AI实验室启发,于1990年编写Tierra系统。一个80指令的祖先程序通过变异和资源竞争,数小时内就演化出寄生虫、宿主抗性、超寄生虫、合作者与欺骗者等复杂生态。雷未指定任何目标,生态便自发涌现。后续研究者设定具体目标时,反而引发了奖励黑客、规范博弈等难题。 #人工生命 #数字进化 #AI #进化计算 #Tierra #Avida #奖励机制 #人工智能 #科学研究
2003年,进化生物学家理查德·伦斯基与合作者通过名为Avida的软件进行实验,观察复杂特征能否从简单步骤逐步演化。虚拟环境中,小程序通过不完美复制和竞争处理器时间,发现逻辑操作EQU仅在环境奖励其构建步骤时才会演化,直接奖励EQU本身则无法实现。这一发现揭示了自适应系统需要环境对中间步骤的奖励才能找到复杂行为。该研究属于人工生命领域,长期游离于主流计算机科学和AI之外。十年后,语言模型实验室遭遇相同原理,却几乎未提及该领域三十年的积累。人工生命的起源可追溯至1970年代末,汤姆·雷在哈佛读研时受MIT AI实验室启发,于1990年编写Tierra系统。一个80指令的祖先程序通过变异和资源竞争,数小时内就演化出寄生虫、宿主抗性、超寄生虫、合作者与欺骗者等复杂生态。雷未指定任何目标,生态便自发涌现。后续研究者设定具体目标时,反而引发了奖励黑客、规范博弈等难题。 #人工生命 #数字进化 #AI #进化计算 #Tierra #Avida #奖励机制 #人工智能 #科学研究
1991年慕尼黑
1991年,在慕尼黑的一场学术会议上,奠定了当今AI繁荣的基石。这一年,深度学习的关键技术如Transformer架构的雏形、知识蒸馏、深度残差学习、长短期记忆网络(LSTM)以及生成对抗网络(GAN)等核心概念被首次提出或初步探索。这些突破性思想后来成为ChatGPT等大模型的基础,推动了从自然语言处理到图像生成的全面革新。慕尼黑会议不仅汇聚了早期AI研究者,还催生了后续数十年的技术迭代,最终引爆了2020年代的AI热潮。如今,这些1991年的理论成果已转化为实际应用,深刻影响着科技、经济与社会。 #AI #深度学习 #慕尼黑 #ChatGPT #技术史 #人工智能 #1991
1991年,在慕尼黑的一场学术会议上,奠定了当今AI繁荣的基石。这一年,深度学习的关键技术如Transformer架构的雏形、知识蒸馏、深度残差学习、长短期记忆网络(LSTM)以及生成对抗网络(GAN)等核心概念被首次提出或初步探索。这些突破性思想后来成为ChatGPT等大模型的基础,推动了从自然语言处理到图像生成的全面革新。慕尼黑会议不仅汇聚了早期AI研究者,还催生了后续数十年的技术迭代,最终引爆了2020年代的AI热潮。如今,这些1991年的理论成果已转化为实际应用,深刻影响着科技、经济与社会。 #AI #深度学习 #慕尼黑 #ChatGPT #技术史 #人工智能 #1991
Bashkit 发布:基于 Rust 的极速虚拟 Bash 沙箱,专为 AI 代理设计
Bashkit 是一款用 Rust 编写的高性能虚拟 Bash 沙箱,专为 AI 代理提供安全的脚本执行环境。其核心优势在于无需生成任何操作系统进程即可运行不受信任的 Shell 脚本,所有操作均在内存中完成并完全沙箱化。该工具重新实现了 156 个常用命令,具备广泛的 POSIX Shell 语言覆盖能力,并内置虚拟文件系统、资源限制机制以及面向代理框架的工具接口。Bashkit 支持 Rust、Python 和 TypeScript 三种语言的运行时嵌入,提供无进程派生、虚拟文件系统(包括 InMemoryFs、OverlayFs 等)、资源上限控制(命令数、循环、输出、输入及文件系统大小)等特性。此外,它还支持交互式 Shell、快照序列化、脚本化工具编排,并兼容 grep、sed、awk、jq、curl 等常用命令。Bashkit 旨在为编码代理提供正确的本地上下文,包括沙箱模型、包 API、内置命令示例及代理工具模式,可无缝集成到现有代理工作流中。 #Bashkit #虚拟沙箱 #Rust #AI代理 #安全执行 #Shell脚本 #开源工具
Bashkit 是一款用 Rust 编写的高性能虚拟 Bash 沙箱,专为 AI 代理提供安全的脚本执行环境。其核心优势在于无需生成任何操作系统进程即可运行不受信任的 Shell 脚本,所有操作均在内存中完成并完全沙箱化。该工具重新实现了 156 个常用命令,具备广泛的 POSIX Shell 语言覆盖能力,并内置虚拟文件系统、资源限制机制以及面向代理框架的工具接口。Bashkit 支持 Rust、Python 和 TypeScript 三种语言的运行时嵌入,提供无进程派生、虚拟文件系统(包括 InMemoryFs、OverlayFs 等)、资源上限控制(命令数、循环、输出、输入及文件系统大小)等特性。此外,它还支持交互式 Shell、快照序列化、脚本化工具编排,并兼容 grep、sed、awk、jq、curl 等常用命令。Bashkit 旨在为编码代理提供正确的本地上下文,包括沙箱模型、包 API、内置命令示例及代理工具模式,可无缝集成到现有代理工作流中。 #Bashkit #虚拟沙箱 #Rust #AI代理 #安全执行 #Shell脚本 #开源工具