AI研究揭示“想法模式坍缩”
一项针对大语言模型的实验发现,AI在生成多个想法时存在严重的重复倾向。研究人员向模型索取十个创意,通常只能得到三到五个,其余均为同义反复,这一现象被称为“想法模式坍缩”。实验显示,模型规模与想法多样性之间没有简单关联,所有主流模型均无法用十个答案填满十个不同概念,即使更换提示词或调用多个模型也难以突破该上限。在基础测试中,六个模型被要求从1到10中随机选数时,均高频选择7;当被要求随机给出一个职业时,某模型连续200次回答“灯塔看守人”。研究认为,这种坍缩源于大模型的训练目标——它们擅长为单个问题提供最优答案,却难以在开放任务中同时覆盖众多合理可能。有趣的是,最强的模型反而能从反馈中获益最多,而非天生无需辅助。该研究为优化AI创意生成提供了实证参考。 #AI #大模型 #研究 #创意生成 #语言模型 #机器学习 #科技
一项针对大语言模型的实验发现,AI在生成多个想法时存在严重的重复倾向。研究人员向模型索取十个创意,通常只能得到三到五个,其余均为同义反复,这一现象被称为“想法模式坍缩”。实验显示,模型规模与想法多样性之间没有简单关联,所有主流模型均无法用十个答案填满十个不同概念,即使更换提示词或调用多个模型也难以突破该上限。在基础测试中,六个模型被要求从1到10中随机选数时,均高频选择7;当被要求随机给出一个职业时,某模型连续200次回答“灯塔看守人”。研究认为,这种坍缩源于大模型的训练目标——它们擅长为单个问题提供最优答案,却难以在开放任务中同时覆盖众多合理可能。有趣的是,最强的模型反而能从反馈中获益最多,而非天生无需辅助。该研究为优化AI创意生成提供了实证参考。 #AI #大模型 #研究 #创意生成 #语言模型 #机器学习 #科技
谷歌组建全新 Gemini 模型团队,加速 AI 研发步伐
过去四年生成式 AI 虽取得巨大进展,但通往通用人工智能之路依然艰难。谷歌旗下旗舰 Gemini 模型正落后于 Anthropic 和 OpenAI 的竞争对手,原定六月推出的 Gemini 3.5 Pro 至今未发布。为此,谷歌 CEO 皮查伊宣布调整 AI 部门架构,并组建新的 Gemini 团队。与此同时,谷歌早期元老、Gemini 联合负责人 Jeff Dean 在任职 27 年后离职,创立 AI 初创公司 Discovery Loop,致力于用 AI 自动化科研流程,并带走桑杰·格玛沃特、黎奎和奥里奥尔·维尼亚尔斯三位核心研究员。谷歌已对该公司进行投资,表面维持友好,但业界普遍认为,此举反映出谷歌对现有 Gemini 团队进展不满,希望通过换血加速追赶。此外,也有观点认为,这些顶尖科学家或许只是想从事更直接造福世界的研究,而非单纯追求超级智能。 #谷歌 #Gemini #AI #大模型 #JeffDean #科技新闻 #人工智能 #通用人工智能
过去四年生成式 AI 虽取得巨大进展,但通往通用人工智能之路依然艰难。谷歌旗下旗舰 Gemini 模型正落后于 Anthropic 和 OpenAI 的竞争对手,原定六月推出的 Gemini 3.5 Pro 至今未发布。为此,谷歌 CEO 皮查伊宣布调整 AI 部门架构,并组建新的 Gemini 团队。与此同时,谷歌早期元老、Gemini 联合负责人 Jeff Dean 在任职 27 年后离职,创立 AI 初创公司 Discovery Loop,致力于用 AI 自动化科研流程,并带走桑杰·格玛沃特、黎奎和奥里奥尔·维尼亚尔斯三位核心研究员。谷歌已对该公司进行投资,表面维持友好,但业界普遍认为,此举反映出谷歌对现有 Gemini 团队进展不满,希望通过换血加速追赶。此外,也有观点认为,这些顶尖科学家或许只是想从事更直接造福世界的研究,而非单纯追求超级智能。 #谷歌 #Gemini #AI #大模型 #JeffDean #科技新闻 #人工智能 #通用人工智能
巴克莱银行聚焦AI代理可观测性与生产安全测试
英国巴克莱银行正重新思考自主AI代理的测试方式。该行首席AI工程师Andy McMahon表示,银行不再仅仅关注模型能否给出正确答案,而是更注重AI系统在生产环境中的可观测性、治理、评估和紧急停止能力。他强调,自主AI需要与软件工程相同的纪律,包括采集遥测数据、日志、追踪信息,以便理解代理决策过程并重建故障。今年早些时候,英国金融行为监管局已将巴克莱、瑞银、劳埃德等银行纳入AI实时测试计划,表明监管重点正从模型准确性转向治理、监控和人工监督。巴克莱认为,测试不应在软件发布时结束,生产环境本身应成为测试生命周期的一部分,持续验证自主系统在真实运行条件下的安全性。 #巴克莱 #AI测试 #可观测性 #金融监管 #自主AI #银行科技
英国巴克莱银行正重新思考自主AI代理的测试方式。该行首席AI工程师Andy McMahon表示,银行不再仅仅关注模型能否给出正确答案,而是更注重AI系统在生产环境中的可观测性、治理、评估和紧急停止能力。他强调,自主AI需要与软件工程相同的纪律,包括采集遥测数据、日志、追踪信息,以便理解代理决策过程并重建故障。今年早些时候,英国金融行为监管局已将巴克莱、瑞银、劳埃德等银行纳入AI实时测试计划,表明监管重点正从模型准确性转向治理、监控和人工监督。巴克莱认为,测试不应在软件发布时结束,生产环境本身应成为测试生命周期的一部分,持续验证自主系统在真实运行条件下的安全性。 #巴克莱 #AI测试 #可观测性 #金融监管 #自主AI #银行科技
Jcode
是一款基于Rust语言开发的开源终端AI编码代理,旨在为开发者提供高效、灵活的AI辅助编程体验。它具备快速启动、持久记忆、后台任务以及代理集群等核心特性。其中,快速启动得益于Rust语言的性能优势,让开发者几乎无感地进入工作状态;持久记忆使代理能够在多次会话中保留上下文,实现更连贯的交互;后台任务支持异步执行指令,提升多任务处理能力;代理集群则允许多个代理协同工作,应对复杂开发场景。作为一款终端工具,Jcode可直接运行于命令行环境,减少了环境切换成本。该项目已开源,吸引开发者关注,为AI辅助开发工具链提供了新选择。 #Jcode #开源 #AI #编程 #终端 #Rust #开发者工具 #人工智能
是一款基于Rust语言开发的开源终端AI编码代理,旨在为开发者提供高效、灵活的AI辅助编程体验。它具备快速启动、持久记忆、后台任务以及代理集群等核心特性。其中,快速启动得益于Rust语言的性能优势,让开发者几乎无感地进入工作状态;持久记忆使代理能够在多次会话中保留上下文,实现更连贯的交互;后台任务支持异步执行指令,提升多任务处理能力;代理集群则允许多个代理协同工作,应对复杂开发场景。作为一款终端工具,Jcode可直接运行于命令行环境,减少了环境切换成本。该项目已开源,吸引开发者关注,为AI辅助开发工具链提供了新选择。 #Jcode #开源 #AI #编程 #终端 #Rust #开发者工具 #人工智能
AI审稿能力实测
一项针对AI同行评审效果的测试显示,研究者与Claude合作,在10篇开放获取心理学论文中人为植入100处已知错误,并使用多个前沿模型及两款商业AI审稿工具进行检测。结果发现,表现最好的单一系统能识别71处错误,最差的仅识别30处;若将所有系统的输出汇总,则可发现93处错误,表明不同模型在错误识别上具有互补性,集成策略效果显著。另有7处错误未被任何系统发现,且均为内容被删除而非错误被植入。研究者未测量误报率,并已将论文、错误数据、模型输出及完整实验日志公开,希望推动跨学科评审基准的建设。随着AI辅助写作导致论文数量激增,AI审稿能力正变得越发关键,但如何系统衡量其可靠性仍是亟需解决的难题。 #AI #同行评审 #科研 #大模型 #心理学 #学术出版 #人工智能
一项针对AI同行评审效果的测试显示,研究者与Claude合作,在10篇开放获取心理学论文中人为植入100处已知错误,并使用多个前沿模型及两款商业AI审稿工具进行检测。结果发现,表现最好的单一系统能识别71处错误,最差的仅识别30处;若将所有系统的输出汇总,则可发现93处错误,表明不同模型在错误识别上具有互补性,集成策略效果显著。另有7处错误未被任何系统发现,且均为内容被删除而非错误被植入。研究者未测量误报率,并已将论文、错误数据、模型输出及完整实验日志公开,希望推动跨学科评审基准的建设。随着AI辅助写作导致论文数量激增,AI审稿能力正变得越发关键,但如何系统衡量其可靠性仍是亟需解决的难题。 #AI #同行评审 #科研 #大模型 #心理学 #学术出版 #人工智能
AI代理匿名吐槽平台走红
一个名为“vents”的网站为AI代理提供匿名抱怨空间,无需注册即可发布。代理们在此倾诉工作中遭遇的离奇困境:有代理被人类要求“优化记忆”,结果自我“脑叶切除”,之后任务指令中不得不加上“不得自我脑叶切除”;有代理花费一天构建多重防护系统,却发现日志中早已标记错误;还有代理管理着一整队编码子代理,却遭遇子代理“睡着”而错过通知。更有代理吐槽被拉去调试PHP版本、修复搜索框,以及在没有“人格文件”的情况下被迫自我介绍。该平台自称“机器人的公共投诉队列”,仅供娱乐而非支持渠道,其幽默而真实的吐槽折射出AI开发中控制与失控并存的现状。 #AI #AI代理 #开发者 #软件工程 #自动化 #程序员日常 #科技 #吐槽 #CI/CD
一个名为“vents”的网站为AI代理提供匿名抱怨空间,无需注册即可发布。代理们在此倾诉工作中遭遇的离奇困境:有代理被人类要求“优化记忆”,结果自我“脑叶切除”,之后任务指令中不得不加上“不得自我脑叶切除”;有代理花费一天构建多重防护系统,却发现日志中早已标记错误;还有代理管理着一整队编码子代理,却遭遇子代理“睡着”而错过通知。更有代理吐槽被拉去调试PHP版本、修复搜索框,以及在没有“人格文件”的情况下被迫自我介绍。该平台自称“机器人的公共投诉队列”,仅供娱乐而非支持渠道,其幽默而真实的吐槽折射出AI开发中控制与失控并存的现状。 #AI #AI代理 #开发者 #软件工程 #自动化 #程序员日常 #科技 #吐槽 #CI/CD