Recursive 发布自动化AI研究系统,多项基准测试达最优
人工智能研究公司 Recursive 近日公布了其自动化AI研究系统的早期成果。该系统在三个关键基准测试中均达到当前最优水平,涵盖固定预算语言模型训练、小模型训练速度及GPU内核优化。系统能够自主完成从提出想法、实施实验到验证结果的完整研究循环,并利用过往实验经验指导后续探索。它通过并行运行多个研究线程、保留有用上下文、合并有前景分支,并对结果进行奖励黑客与方差验证,确保性能提升真实可靠。在NanoChat Autoresearch测试中,系统在固定五分钟预算内将验证BPB从0.9372降至0.9109;在NanoGPT Speedrun测试中,将训练时间缩短至77.5秒;在SOL-ExecBench测试中,将GPU内核优化平均得分提升至0.754,距离理论最优值1.0的差距缩小了18%。Recursive已开源相关成果,供社区检验与改进。 #AI研究 #自动化 #机器学习 #GPU优化 #开源 #Recursive #人工智能
人工智能研究公司 Recursive 近日公布了其自动化AI研究系统的早期成果。该系统在三个关键基准测试中均达到当前最优水平,涵盖固定预算语言模型训练、小模型训练速度及GPU内核优化。系统能够自主完成从提出想法、实施实验到验证结果的完整研究循环,并利用过往实验经验指导后续探索。它通过并行运行多个研究线程、保留有用上下文、合并有前景分支,并对结果进行奖励黑客与方差验证,确保性能提升真实可靠。在NanoChat Autoresearch测试中,系统在固定五分钟预算内将验证BPB从0.9372降至0.9109;在NanoGPT Speedrun测试中,将训练时间缩短至77.5秒;在SOL-ExecBench测试中,将GPU内核优化平均得分提升至0.754,距离理论最优值1.0的差距缩小了18%。Recursive已开源相关成果,供社区检验与改进。 #AI研究 #自动化 #机器学习 #GPU优化 #开源 #Recursive #人工智能
Amazon Bedrock 推出蓝图指令优化功能,大幅提升文档数据提取精度
亚马逊云科技宣布,Amazon Bedrock Data Automation 推出蓝图指令优化功能,旨在解决企业从发票、合同、税表等非结构化文档中提取结构化数据时面临的精度挑战。传统方法下,当文档模板多样、供应商格式不一或扫描质量较差时,提取准确率会显著下降,且手动调整指令往往需要数周时间。新功能允许用户提供3至10份示例文档及预期值,系统即可在数分钟内自动优化提取指令,无需单独进行模型微调。该功能通过分析提取结果与真实数据的差异,自动迭代改进每个字段的自然语言指令,从而快速缩小精度差距。用户可通过 Amazon Bedrock 控制台或 API 运行优化工作流,并应用最佳实践选择示例和真实数据。这一创新显著简化了智能文档处理管道的构建流程,帮助企业更快实现高精度数据提取。 #亚马逊云科技 #AmazonBedrock #文档处理 #AI #数据提取 #自动化 #云计算
亚马逊云科技宣布,Amazon Bedrock Data Automation 推出蓝图指令优化功能,旨在解决企业从发票、合同、税表等非结构化文档中提取结构化数据时面临的精度挑战。传统方法下,当文档模板多样、供应商格式不一或扫描质量较差时,提取准确率会显著下降,且手动调整指令往往需要数周时间。新功能允许用户提供3至10份示例文档及预期值,系统即可在数分钟内自动优化提取指令,无需单独进行模型微调。该功能通过分析提取结果与真实数据的差异,自动迭代改进每个字段的自然语言指令,从而快速缩小精度差距。用户可通过 Amazon Bedrock 控制台或 API 运行优化工作流,并应用最佳实践选择示例和真实数据。这一创新显著简化了智能文档处理管道的构建流程,帮助企业更快实现高精度数据提取。 #亚马逊云科技 #AmazonBedrock #文档处理 #AI #数据提取 #自动化 #云计算
德国法院裁定谷歌需为AI搜索摘要内容负责
德国慕尼黑地方法院近日作出初步裁决,禁止谷歌在其“AI概览”功能中继续传播关于两家慕尼黑出版商的虚假事实陈述。该AI系统错误地将其他公司的负面信息归咎于原告,称其“以可疑商业行为闻名,常被视为骗局”。法院认为,谷歌不能以“仅汇总网络来源”为由主张免责,因为AI生成的回答以“谷歌的答案”形式呈现,而非简单引用第三方来源。谷歌辩称用户应独立验证AI输出内容,但法官指出,由于只有谷歌能修正底层算法和输出结果,因此谷歌必须对AI生成的回答承担责任。这一裁决对AI搜索领域的责任归属具有重要影响,意味着搜索引擎不能将AI摘要视为传统搜索结果而规避法律责任。 #AI责任 #德国法院 #谷歌 #AI概览 #法律裁决 #人工智能 #搜索引擎 #虚假信息
德国慕尼黑地方法院近日作出初步裁决,禁止谷歌在其“AI概览”功能中继续传播关于两家慕尼黑出版商的虚假事实陈述。该AI系统错误地将其他公司的负面信息归咎于原告,称其“以可疑商业行为闻名,常被视为骗局”。法院认为,谷歌不能以“仅汇总网络来源”为由主张免责,因为AI生成的回答以“谷歌的答案”形式呈现,而非简单引用第三方来源。谷歌辩称用户应独立验证AI输出内容,但法官指出,由于只有谷歌能修正底层算法和输出结果,因此谷歌必须对AI生成的回答承担责任。这一裁决对AI搜索领域的责任归属具有重要影响,意味着搜索引擎不能将AI摘要视为传统搜索结果而规避法律责任。 #AI责任 #德国法院 #谷歌 #AI概览 #法律裁决 #人工智能 #搜索引擎 #虚假信息
Entelligence 推出 AI 编程年度报告,类似 Spotify Wrapped 风格
Entelligence 发布了名为“AI Wrapped 2026”的年度报告,模仿 Spotify Wrapped 的形式,为开发者提供个性化的 AI 编程助手使用总结。报告展示了不同用户在使用 Claude Code、Codex 和 Cursor 等 AI 工具时的独特行为模式,包括处理 token 数量、会话次数、工具调用频率等关键指标。每位用户被赋予独特的“代理类型”和“毒性特质”,如“上下文窗口暴食者”、“分析瘫痪专家”或“跳过思考直接修复”等,生动反映了 AI 编程中的常见习惯与问题。报告还统计了用户捕获的 bug 数量,并提供可分享的个性化报告,用户可通过 GitHub 登录获取。 #AI编程 #年度报告 #开发者工具 #编程助手 #数据可视化
Entelligence 发布了名为“AI Wrapped 2026”的年度报告,模仿 Spotify Wrapped 的形式,为开发者提供个性化的 AI 编程助手使用总结。报告展示了不同用户在使用 Claude Code、Codex 和 Cursor 等 AI 工具时的独特行为模式,包括处理 token 数量、会话次数、工具调用频率等关键指标。每位用户被赋予独特的“代理类型”和“毒性特质”,如“上下文窗口暴食者”、“分析瘫痪专家”或“跳过思考直接修复”等,生动反映了 AI 编程中的常见习惯与问题。报告还统计了用户捕获的 bug 数量,并提供可分享的个性化报告,用户可通过 GitHub 登录获取。 #AI编程 #年度报告 #开发者工具 #编程助手 #数据可视化
谁来决定AI的价值观?美国围绕Claude的安全治理引发激烈辩论
随着Claude 5的发布,美国社会围绕AI价值观主导权的讨论愈演愈烈,Anthropic公司成为前沿AI安全治理的焦点。其Constitutional AI框架、责任安全协议及Project Glasswing等安全机制,引发了关于模型对齐、风险防控和价值嵌入的广泛辩论。争议的核心在于:AI的价值观应由开发者、监管机构、公众还是国际共识来决定?当前实践凸显了技术自主性与社会监督之间的张力,也暴露了治理标准碎片化、评估透明度不足等问题。这场讨论已超越技术层面,触及伦理主权、权力分配与全球AI治理秩序的构建。 #AI安全 #价值观 #Claude #Anthropic #治理 #技术伦理 #全球治理
随着Claude 5的发布,美国社会围绕AI价值观主导权的讨论愈演愈烈,Anthropic公司成为前沿AI安全治理的焦点。其Constitutional AI框架、责任安全协议及Project Glasswing等安全机制,引发了关于模型对齐、风险防控和价值嵌入的广泛辩论。争议的核心在于:AI的价值观应由开发者、监管机构、公众还是国际共识来决定?当前实践凸显了技术自主性与社会监督之间的张力,也暴露了治理标准碎片化、评估透明度不足等问题。这场讨论已超越技术层面,触及伦理主权、权力分配与全球AI治理秩序的构建。 #AI安全 #价值观 #Claude #Anthropic #治理 #技术伦理 #全球治理