Artificial Analysis 发布语音到语音模型评测指数
Artificial Analysis 宣布推出全新的“语音到语音指数”,用于评估原生语音模型的质量。该指数综合三个核心维度:语音推理(Big Bench Audio)、对话动态(Full Duplex Bench)和智能体性能(τ-Voice),三个数据集权重相同。评测显示,OpenAI GPT-Realtime-2(High)以77.2%的指数得分领先,xAI Grok Voice Think Fast 1.0以75.7%紧随其后,GPT-Realtime-1.5(72.0%)和Google Gemini 3.1 Flash Live Preview(High)(69.5%)分列其后。在对话动态方面,GPT-Realtime-2(Minimal)以96.1%排名第一;智能体性能是差距最大的维度,Grok Voice Think Fast 1.0以52.1%领先,所有模型均低于53%;语音推理方面,Grok Voice Think Fast 1.0以97.1%居首。速度方面,Deepslate Opal首帧音频时间仅为0.44秒,GPT-Realtime-1.5为0.82秒;成本方面,Gemini 3.1 Flash Live Preview(Minimal)每小时输入音频成本最低,为1.50美元。 #AI #语音模型 #评测 #性能 #成本 #OpenAI #谷歌 #xAI
Artificial Analysis 宣布推出全新的“语音到语音指数”,用于评估原生语音模型的质量。该指数综合三个核心维度:语音推理(Big Bench Audio)、对话动态(Full Duplex Bench)和智能体性能(τ-Voice),三个数据集权重相同。评测显示,OpenAI GPT-Realtime-2(High)以77.2%的指数得分领先,xAI Grok Voice Think Fast 1.0以75.7%紧随其后,GPT-Realtime-1.5(72.0%)和Google Gemini 3.1 Flash Live Preview(High)(69.5%)分列其后。在对话动态方面,GPT-Realtime-2(Minimal)以96.1%排名第一;智能体性能是差距最大的维度,Grok Voice Think Fast 1.0以52.1%领先,所有模型均低于53%;语音推理方面,Grok Voice Think Fast 1.0以97.1%居首。速度方面,Deepslate Opal首帧音频时间仅为0.44秒,GPT-Realtime-1.5为0.82秒;成本方面,Gemini 3.1 Flash Live Preview(Minimal)每小时输入音频成本最低,为1.50美元。 #AI #语音模型 #评测 #性能 #成本 #OpenAI #谷歌 #xAI
IatroBench 研究揭示AI安全措施可能引发医源性伤害
一项名为 IatroBench 的预注册研究提供了系统性证据,表明某些人工智能安全措施可能产生医源性伤害。该研究由 David Gringras 主导,论文已提交至 arXiv 预印本平台。研究通过标准化基准测试,评估了多种常见 AI 安全策略在实际应用中的副作用,发现部分旨在提升模型安全性的方法反而可能导致模型性能下降、输出偏差增加或产生新的安全隐患。这一发现对当前 AI 安全领域的主流实践提出了重要警示,提示开发者在实施安全措施时需谨慎权衡其潜在负面影响。研究团队呼吁业界建立更全面的评估框架,以识别和缓解安全措施可能带来的意外后果。 #AI安全 #医源性伤害 #人工智能 #安全评估 #预注册研究
一项名为 IatroBench 的预注册研究提供了系统性证据,表明某些人工智能安全措施可能产生医源性伤害。该研究由 David Gringras 主导,论文已提交至 arXiv 预印本平台。研究通过标准化基准测试,评估了多种常见 AI 安全策略在实际应用中的副作用,发现部分旨在提升模型安全性的方法反而可能导致模型性能下降、输出偏差增加或产生新的安全隐患。这一发现对当前 AI 安全领域的主流实践提出了重要警示,提示开发者在实施安全措施时需谨慎权衡其潜在负面影响。研究团队呼吁业界建立更全面的评估框架,以识别和缓解安全措施可能带来的意外后果。 #AI安全 #医源性伤害 #人工智能 #安全评估 #预注册研究
AI新潮流“循环工程”仍需人类参与
近期,AI圈掀起“循环工程”(Loop Engineering)新浪潮,取代了去年的“提示工程”。专家声称,不应再手动编写提示词并检查每次回复,而应设计循环让AI代理自动执行多步骤任务。然而,这种自动化的背后是AI公司对token消耗的狂热推广——OpenAI、Anthropic等公司渴望用户为自动循环支付更多费用。批评者指出,这如同负债累累的公用事业公司建议用户整夜不关灯。开发者Addy Osmani在博客中强调,“循环改变了工作,但没有将你从中删除”,暗示自动化风险:非确定性AI模型可能产生错误,仍需人类监督。这场讨论提醒人们,无论技术如何演进,“人在循环中”的角色不可替代。 #AI #循环工程 #提示工程 #自动化 #人工智能 #技术新闻 #token消耗 #人在循环
近期,AI圈掀起“循环工程”(Loop Engineering)新浪潮,取代了去年的“提示工程”。专家声称,不应再手动编写提示词并检查每次回复,而应设计循环让AI代理自动执行多步骤任务。然而,这种自动化的背后是AI公司对token消耗的狂热推广——OpenAI、Anthropic等公司渴望用户为自动循环支付更多费用。批评者指出,这如同负债累累的公用事业公司建议用户整夜不关灯。开发者Addy Osmani在博客中强调,“循环改变了工作,但没有将你从中删除”,暗示自动化风险:非确定性AI模型可能产生错误,仍需人类监督。这场讨论提醒人们,无论技术如何演进,“人在循环中”的角色不可替代。 #AI #循环工程 #提示工程 #自动化 #人工智能 #技术新闻 #token消耗 #人在循环
93%的企业因AI导致基础设施事故,治理滞后成隐患
根据Spacelift发布的《2026年基础设施自动化状况报告》,一项针对406名IT决策者的调查显示,93%的组织报告了因AI引发的基础设施事故,但仅19%拥有必要的治理能力。报告指出存在“AI准备差距”,企业尚未准备好就急于采用AI,为此付出代价。事故后果包括返工AI生成的更改(37%)、安全配置错误进入生产环境(36%)、合规违规(36%)等。24%的组织被归类为“暴露”——使用AI但缺乏安全治理;32%为“碎片化”——使用不均衡;25%“超前”但控制不足;仅19%为“先驱”——有结构纪律。此外,82%的受访者表示25%-74%的代码由AI生成,导致安全漏洞增多、治理挑战加剧。尽管86%声称能治理AI,但仅30%有正式AI治理政策。 #AI #基础设施 #事故 #治理 #企业 #技术新闻 #Spacelift #调查 #风险 #自动化
根据Spacelift发布的《2026年基础设施自动化状况报告》,一项针对406名IT决策者的调查显示,93%的组织报告了因AI引发的基础设施事故,但仅19%拥有必要的治理能力。报告指出存在“AI准备差距”,企业尚未准备好就急于采用AI,为此付出代价。事故后果包括返工AI生成的更改(37%)、安全配置错误进入生产环境(36%)、合规违规(36%)等。24%的组织被归类为“暴露”——使用AI但缺乏安全治理;32%为“碎片化”——使用不均衡;25%“超前”但控制不足;仅19%为“先驱”——有结构纪律。此外,82%的受访者表示25%-74%的代码由AI生成,导致安全漏洞增多、治理挑战加剧。尽管86%声称能治理AI,但仅30%有正式AI治理政策。 #AI #基础设施 #事故 #治理 #企业 #技术新闻 #Spacelift #调查 #风险 #自动化
AI代理初创公司 Lindy 从 Claude 切换到 DeepSeek v4,每年节省数百万美元
AI 代理初创公司 Lindy 宣布将所有流量从 Anthropic 的模型迁移至 DeepSeek v4,每年节省数百万美元推理成本。CEO Flo Crivello 表示,迁移工作量比预期高出 100 倍,包括大量在线和离线评估、提示词调整等。这一决策源于推理成本已成为公司最大单一支出,甚至超过工资单。DeepSeek v4 是中国 AI 研究公司的开源模型,由美国服务商 Atlas Cloud 托管,在多数核心用例上性能有提升,但在复杂工作流自动化上仍落后于 Anthropic 的 Sonnet。此次迁移反映了 AI 模型市场两极分化趋势:超高端前沿模型与廉价开放权重替代品之间的中间地带正在萎缩。Lindy 仍内部使用 Claude,但外部产品将主要依赖 DeepSeek。 #AI代理 #DeepSeek #Claude #推理成本 #开源模型 #Lindy #Anthropic #模型迁移 #成本优化 #地缘政治
AI 代理初创公司 Lindy 宣布将所有流量从 Anthropic 的模型迁移至 DeepSeek v4,每年节省数百万美元推理成本。CEO Flo Crivello 表示,迁移工作量比预期高出 100 倍,包括大量在线和离线评估、提示词调整等。这一决策源于推理成本已成为公司最大单一支出,甚至超过工资单。DeepSeek v4 是中国 AI 研究公司的开源模型,由美国服务商 Atlas Cloud 托管,在多数核心用例上性能有提升,但在复杂工作流自动化上仍落后于 Anthropic 的 Sonnet。此次迁移反映了 AI 模型市场两极分化趋势:超高端前沿模型与廉价开放权重替代品之间的中间地带正在萎缩。Lindy 仍内部使用 Claude,但外部产品将主要依赖 DeepSeek。 #AI代理 #DeepSeek #Claude #推理成本 #开源模型 #Lindy #Anthropic #模型迁移 #成本优化 #地缘政治
Zedra
是一款面向 AI 编程代理的远程控制工具,支持终端、编辑器、Markdown 和 Git 操作。用户可通过 QR 码配对建立安全隧道,无需 VPN 或端口转发,实现跨设备远程编码。该工具支持 Mac、Linux 和 Windows 平台,并提供一键安装脚本。Zedra 能够集成 Claude Code、Codex 和 OpenCode 等主流 AI 编程工具,通过安装代理钩子实现任务通知和启动管理。此外,其 iOS Beta 版已进入封闭测试阶段,进一步拓展移动端使用场景。 #Zedra #AI编程 #远程控制 #开发者工具 #开源 #ClaudeCode #Codex #OpenCode
是一款面向 AI 编程代理的远程控制工具,支持终端、编辑器、Markdown 和 Git 操作。用户可通过 QR 码配对建立安全隧道,无需 VPN 或端口转发,实现跨设备远程编码。该工具支持 Mac、Linux 和 Windows 平台,并提供一键安装脚本。Zedra 能够集成 Claude Code、Codex 和 OpenCode 等主流 AI 编程工具,通过安装代理钩子实现任务通知和启动管理。此外,其 iOS Beta 版已进入封闭测试阶段,进一步拓展移动端使用场景。 #Zedra #AI编程 #远程控制 #开发者工具 #开源 #ClaudeCode #Codex #OpenCode
多流时间融合方法用于金融欺诈检测
一篇题为《Multi-Stream Temporal Fusion for Financial Fraud Detection》的学术论文近日在arXiv预印本平台发布。该论文由Mohammadamin Dashti Moghaddam和Nick Sciarrilli共同撰写,提出了一种基于多流时间融合的金融欺诈检测方法。该方法通过融合多个时间序列数据流,旨在提升对复杂金融欺诈行为的识别能力。论文提交于2026年6月23日,目前处于arXiv登记阶段,尚未正式分配DOI。研究有望为金融安全领域提供新的技术思路。 #金融欺诈 #时间序列 #多流融合 #arXiv #论文 #机器学习 #金融安全
一篇题为《Multi-Stream Temporal Fusion for Financial Fraud Detection》的学术论文近日在arXiv预印本平台发布。该论文由Mohammadamin Dashti Moghaddam和Nick Sciarrilli共同撰写,提出了一种基于多流时间融合的金融欺诈检测方法。该方法通过融合多个时间序列数据流,旨在提升对复杂金融欺诈行为的识别能力。论文提交于2026年6月23日,目前处于arXiv登记阶段,尚未正式分配DOI。研究有望为金融安全领域提供新的技术思路。 #金融欺诈 #时间序列 #多流融合 #arXiv #论文 #机器学习 #金融安全
内存高效等变Transformer实现可扩展肽设计
近日,一篇题为《Scalable Peptide Design via Memory-Efficient Equivariant Transformer》的论文引起关注。该研究由Rui Jiao等学者提出,创新性地将等变Transformer架构与内存优化技术结合,用于解决多肽设计中的计算瓶颈问题。传统方法在处理长序列肽时面临显存爆炸和计算效率低下的挑战,而该模型通过等变机制保持分子结构的对称性,同时大幅降低内存占用,实现了对更长肽序列的高效生成与优化。实验表明,该方法在序列保真度、结构合理性及多样性上均优于现有基线,为药物研发和生物材料设计提供了新的可扩展工具。论文已提交至arXiv平台,并开放了代码和补充材料供同行验证。 #AI #深度学习 #分子设计 #等变Transformer #肽设计 #生物医药 #计算化学 #arXiv #科研
近日,一篇题为《Scalable Peptide Design via Memory-Efficient Equivariant Transformer》的论文引起关注。该研究由Rui Jiao等学者提出,创新性地将等变Transformer架构与内存优化技术结合,用于解决多肽设计中的计算瓶颈问题。传统方法在处理长序列肽时面临显存爆炸和计算效率低下的挑战,而该模型通过等变机制保持分子结构的对称性,同时大幅降低内存占用,实现了对更长肽序列的高效生成与优化。实验表明,该方法在序列保真度、结构合理性及多样性上均优于现有基线,为药物研发和生物材料设计提供了新的可扩展工具。论文已提交至arXiv平台,并开放了代码和补充材料供同行验证。 #AI #深度学习 #分子设计 #等变Transformer #肽设计 #生物医药 #计算化学 #arXiv #科研
自适应联合压缩与同步方法助力物联网降雨预测
近日,一篇题为《Adaptive Joint Compression and Synchronisation in Federated Split Learning for IoT Rainfall Prediction》的论文在预印本平台arXiv上发布。该研究针对物联网场景下的降雨预测问题,提出了一种在联邦分裂学习框架中的自适应联合压缩与同步方法。该方法旨在优化通信效率与模型性能之间的平衡,通过动态调整压缩率和同步策略,减少因大量物联网设备数据传输带来的带宽和延迟压力,同时保持预测模型的准确性。实验表明,该技术在降低通信开销的同时,能够有效提升降雨预测的实时性和鲁棒性,为智慧气象和城市防汛等应用提供了新的技术路径。 #联邦学习 #分裂学习 #物联网 #降雨预测 #自适应压缩 #通信优化 #AI #气象预测
近日,一篇题为《Adaptive Joint Compression and Synchronisation in Federated Split Learning for IoT Rainfall Prediction》的论文在预印本平台arXiv上发布。该研究针对物联网场景下的降雨预测问题,提出了一种在联邦分裂学习框架中的自适应联合压缩与同步方法。该方法旨在优化通信效率与模型性能之间的平衡,通过动态调整压缩率和同步策略,减少因大量物联网设备数据传输带来的带宽和延迟压力,同时保持预测模型的准确性。实验表明,该技术在降低通信开销的同时,能够有效提升降雨预测的实时性和鲁棒性,为智慧气象和城市防汛等应用提供了新的技术路径。 #联邦学习 #分裂学习 #物联网 #降雨预测 #自适应压缩 #通信优化 #AI #气象预测
Geo-Strat-RL
一篇题为《Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks》的学术论文于2026年6月23日提交至arXiv预印本平台。该论文由Lukas Mosser撰写,提出了一种基于强化学习的地质事件推理方法。研究旨在通过可验证的任务设计,让模型学会理解并推理复杂的地质序列与事件关系,从而提升地质解释的自动化水平。该方法融合了地质学知识与强化学习技术,有望为油气勘探、地下资源评估等领域提供更智能的分析工具。论文目前可通过arXiv获取全文。 #地质 #AI #强化学习 #论文 #arXiv
一篇题为《Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks》的学术论文于2026年6月23日提交至arXiv预印本平台。该论文由Lukas Mosser撰写,提出了一种基于强化学习的地质事件推理方法。研究旨在通过可验证的任务设计,让模型学会理解并推理复杂的地质序列与事件关系,从而提升地质解释的自动化水平。该方法融合了地质学知识与强化学习技术,有望为油气勘探、地下资源评估等领域提供更智能的分析工具。论文目前可通过arXiv获取全文。 #地质 #AI #强化学习 #论文 #arXiv
Hezo:自我托管AI代理团队,隐私密钥永不泄露
Hezo是一款新型自我托管AI代理平台,允许用户创建并运行AI代理团队,而无需暴露真实密钥或依赖云端。其核心机制是:用户通过“CEO”代理描述项目,系统自动分解任务并调配专用容器中的代理团队。每个代理独立运行,用户可实时监控、批准敏感操作并设定预算上限。密钥仅驻留在内存中,从不写入磁盘,且每个代理容器无主机访问权限,所有流量通过代理,一旦出错仅影响单个容器。Git提交由主机端使用项目密钥签名,确保数据与代码所有权完全归属于用户。此外,“教练”代理会自动审查已完成任务并生成可重复使用的规则,避免重复错误。Hezo旨在解决AI代理部署中的安全性与可控性难题,特别适合需要严格数据隔离与合规要求的企业场景。 #AI代理 #隐私安全 #自我托管 #开发者工具 #开源 #云计算替代 #数据隔离
Hezo是一款新型自我托管AI代理平台,允许用户创建并运行AI代理团队,而无需暴露真实密钥或依赖云端。其核心机制是:用户通过“CEO”代理描述项目,系统自动分解任务并调配专用容器中的代理团队。每个代理独立运行,用户可实时监控、批准敏感操作并设定预算上限。密钥仅驻留在内存中,从不写入磁盘,且每个代理容器无主机访问权限,所有流量通过代理,一旦出错仅影响单个容器。Git提交由主机端使用项目密钥签名,确保数据与代码所有权完全归属于用户。此外,“教练”代理会自动审查已完成任务并生成可重复使用的规则,避免重复错误。Hezo旨在解决AI代理部署中的安全性与可控性难题,特别适合需要严格数据隔离与合规要求的企业场景。 #AI代理 #隐私安全 #自我托管 #开发者工具 #开源 #云计算替代 #数据隔离