Strands Evals SDK推出多模态评估工具,解决AI图像任务准确性难题
亚马逊网络服务(AWS)为其开发工具包Strands Evals SDK引入了四个新的多模态大型语言模型(MLLM)作为评判工具,专门用于评估图像到文本生成任务的质量。传统的纯文本评估器无法验证模型输出是否准确基于源图像,而随着多模态企业软件需求激增,这一缺陷导致开发者陷入昂贵的人工审核与不可靠的自动评估两难境地。 新发布的四个评估器分别针对整体质量、正确性、忠实度和指令遵循度进行评分。它们将源图像、查询及模型回复一同发送给多模态评判模型,从而基于视觉内容给出评分和推理依据。这些工具可直接替换现有流程中的纯文本评估器,并集成到持续集成流程中,自动检测视觉幻觉、事实错误和指令违反等问题,显著提升了多模态应用(如发票解析、图表分析、屏幕摘要)的评估可靠性与调试效率。 #多模态评估 #AI工具 #图像理解 #大语言模型 #开发者工具 #自动化测试 #AWS #计算机视觉
亚马逊网络服务(AWS)为其开发工具包Strands Evals SDK引入了四个新的多模态大型语言模型(MLLM)作为评判工具,专门用于评估图像到文本生成任务的质量。传统的纯文本评估器无法验证模型输出是否准确基于源图像,而随着多模态企业软件需求激增,这一缺陷导致开发者陷入昂贵的人工审核与不可靠的自动评估两难境地。 新发布的四个评估器分别针对整体质量、正确性、忠实度和指令遵循度进行评分。它们将源图像、查询及模型回复一同发送给多模态评判模型,从而基于视觉内容给出评分和推理依据。这些工具可直接替换现有流程中的纯文本评估器,并集成到持续集成流程中,自动检测视觉幻觉、事实错误和指令违反等问题,显著提升了多模态应用(如发票解析、图表分析、屏幕摘要)的评估可靠性与调试效率。 #多模态评估 #AI工具 #图像理解 #大语言模型 #开发者工具 #自动化测试 #AWS #计算机视觉
谷歌Gemini 3.5 Flash发布,成本上升但计划全面应用
在2026年5月的大语言模型(LLM)领域,谷歌推出了Gemini 3.5 Flash模型,尽管其价格较前代有所提升,但公司宣布计划将该模型广泛应用于各项产品和服务中。与此同时,业界对大语言模型的速度性能进行了深入探讨,特别是每秒处理10个令牌的实际表现成为焦点。此外,相关文章如Datasette Agent的更新和过去六个月LLM领域的快速变化,进一步凸显了技术迭代的加速。这些进展不仅反映了AI模型在成本与性能间的权衡,还可能推动商业化应用的扩展,促使行业更加关注效率优化和战略部署。 #谷歌 #Gemini #大语言模型 #AI #科技新闻 #人工智能 #速度测试 #商业化
在2026年5月的大语言模型(LLM)领域,谷歌推出了Gemini 3.5 Flash模型,尽管其价格较前代有所提升,但公司宣布计划将该模型广泛应用于各项产品和服务中。与此同时,业界对大语言模型的速度性能进行了深入探讨,特别是每秒处理10个令牌的实际表现成为焦点。此外,相关文章如Datasette Agent的更新和过去六个月LLM领域的快速变化,进一步凸显了技术迭代的加速。这些进展不仅反映了AI模型在成本与性能间的权衡,还可能推动商业化应用的扩展,促使行业更加关注效率优化和战略部署。 #谷歌 #Gemini #大语言模型 #AI #科技新闻 #人工智能 #速度测试 #商业化
亚马逊SageMaker AI与vLLM合作,赋能实时语音应用开发
实时语音代理、直播字幕和客服分析等应用均依赖于低延迟的语音转文字技术,这要求音频流输入与转录结果同步返回。传统请求-响应推理需等待完整音频接收后才开始处理,延迟过高,无法满足实时需求。自2025年11月起,亚马逊SageMaker AI将引入双向流式传输功能,支持客户端与模型容器间连续数据交换;同时,vLLM通过其Realtime API基于WebSocket实现实时音频转录。本文结合这两项技术,展示了如何将Mistral AI的紧凑型实时语音模型Voxtral-Mini-4B-Realtime-2602部署到SageMaker AI端点,利用vLLM容器构建完全托管的实时语音转文字服务。该方案通过协议桥接和健康管理,消除了开发者自建流式基础设施或维护GPU服务器的负担,提供从开源模型到生产级服务的端到端解决方案。 #亚马逊 #SageMakerAI #vLLM #实时语音转文字 #AI #科技新闻 #云计算 #大模型 #语音技术
实时语音代理、直播字幕和客服分析等应用均依赖于低延迟的语音转文字技术,这要求音频流输入与转录结果同步返回。传统请求-响应推理需等待完整音频接收后才开始处理,延迟过高,无法满足实时需求。自2025年11月起,亚马逊SageMaker AI将引入双向流式传输功能,支持客户端与模型容器间连续数据交换;同时,vLLM通过其Realtime API基于WebSocket实现实时音频转录。本文结合这两项技术,展示了如何将Mistral AI的紧凑型实时语音模型Voxtral-Mini-4B-Realtime-2602部署到SageMaker AI端点,利用vLLM容器构建完全托管的实时语音转文字服务。该方案通过协议桥接和健康管理,消除了开发者自建流式基础设施或维护GPU服务器的负担,提供从开源模型到生产级服务的端到端解决方案。 #亚马逊 #SageMakerAI #vLLM #实时语音转文字 #AI #科技新闻 #云计算 #大模型 #语音技术
Google I/O大会发布Gemini Spark与Antigravity AI技术
在2026年5月举行的Google I/O开发者大会上,Google重点展示了其
在2026年5月举行的Google I/O开发者大会上,Google重点展示了其
绿色钢铁初创公司Boston Metal转向关键金属生产并获融资
绿色钢铁初创公司Boston Metal近期获得7500万美元融资,将业务重点从清洁钢铁生产转向铌、钽、镍等关键金属。该公司原以减少钢铁行业碳排放闻名,该行业占全球温室气体排放的8%。其核心技术熔融氧化物电解通过高温电流分离金属,巴西子公司正利用该技术建设商业设施,但此前因工业事故导致现金流问题和裁员。新融资将支持巴西工厂重启,预计2026年9月投入运行,并推动未来在美国生产铬等关键金属项目。公司总融资额已超过5亿美元,此举旨在适应工业脱碳支持减弱的环境并提升生存能力。 #绿色科技 #金属生产 #初创企业 #融资 #工业脱碳 #关键金属 #BostonMetal #环保技术
绿色钢铁初创公司Boston Metal近期获得7500万美元融资,将业务重点从清洁钢铁生产转向铌、钽、镍等关键金属。该公司原以减少钢铁行业碳排放闻名,该行业占全球温室气体排放的8%。其核心技术熔融氧化物电解通过高温电流分离金属,巴西子公司正利用该技术建设商业设施,但此前因工业事故导致现金流问题和裁员。新融资将支持巴西工厂重启,预计2026年9月投入运行,并推动未来在美国生产铬等关键金属项目。公司总融资额已超过5亿美元,此举旨在适应工业脱碳支持减弱的环境并提升生存能力。 #绿色科技 #金属生产 #初创企业 #融资 #工业脱碳 #关键金属 #BostonMetal #环保技术
谷歌发布Gemini 3.5 Flash模型,价格飙升但广泛应用
在谷歌I/O大会上,谷歌正式推出Gemini 3.5 Flash模型,该模型跳过预览阶段直接进入一般可用性,并被集成到谷歌的众多关键免费产品中。技术方面,其知识截止日期为2025年1月,支持高达104万输入token和6.5万输出token,同时谷歌推出了测试版的Interactions API。然而,模型价格显著上涨,达到前代Flash模型的3至6倍,接近Gemini 3.1 Pro版本的定价。行业趋势显示,如OpenAI和Anthropic等AI实验室也在提高模型价格,正在测试API客户的价格承受能力。尽管成本增加,谷歌仍大规模部署该模型,体现了其战略意图。基准测试表明,运行Gemini 3.5 Flash的费用较高,例如生成一个简单SVG示例就花费约13美分。 #谷歌 #Gemini #AI #大模型 #科技新闻 #价格上涨 #模型发布 #人工智能
在谷歌I/O大会上,谷歌正式推出Gemini 3.5 Flash模型,该模型跳过预览阶段直接进入一般可用性,并被集成到谷歌的众多关键免费产品中。技术方面,其知识截止日期为2025年1月,支持高达104万输入token和6.5万输出token,同时谷歌推出了测试版的Interactions API。然而,模型价格显著上涨,达到前代Flash模型的3至6倍,接近Gemini 3.1 Pro版本的定价。行业趋势显示,如OpenAI和Anthropic等AI实验室也在提高模型价格,正在测试API客户的价格承受能力。尽管成本增加,谷歌仍大规模部署该模型,体现了其战略意图。基准测试表明,运行Gemini 3.5 Flash的费用较高,例如生成一个简单SVG示例就花费约13美分。 #谷歌 #Gemini #AI #大模型 #科技新闻 #价格上涨 #模型发布 #人工智能
亚马逊推出语音智能体构建方案,支持多智能体与工具调用
亚马逊发布基于Nova Sonic语音基础模型的可扩展语音智能体设计模式,旨在帮助企业构建低延迟、高可靠的实时语音交互系统。该方案整合了Amazon Nova Sonic(语音对话模型)、Amazon Bedrock AgentCore Runtime(无服务器智能体运行时)和开源框架Strands Agents,通过工具驱动型智能体、子智能体代理工具调用以及会话分段等架构,将大型助手分解为模块化、可重用的组件。 这些设计模式允许开发者通过AgentCore Gateway将业务逻辑封装为可调用的工具,由语音模型直接选择调用,无需中间推理层。该运行时环境提供微虚拟机级会话隔离、双向WebSocket流及语音专用遥测功能,有效减少延迟并保障安全性。亚马逊指出,这种架构能支持更智能、响应更快的客户语音交互体验。 #亚马逊 #NovaSonic #语音智能体 #AI #云计算 #Bedrock #开发者工具 #实时通信 #人工智能
亚马逊发布基于Nova Sonic语音基础模型的可扩展语音智能体设计模式,旨在帮助企业构建低延迟、高可靠的实时语音交互系统。该方案整合了Amazon Nova Sonic(语音对话模型)、Amazon Bedrock AgentCore Runtime(无服务器智能体运行时)和开源框架Strands Agents,通过工具驱动型智能体、子智能体代理工具调用以及会话分段等架构,将大型助手分解为模块化、可重用的组件。 这些设计模式允许开发者通过AgentCore Gateway将业务逻辑封装为可调用的工具,由语音模型直接选择调用,无需中间推理层。该运行时环境提供微虚拟机级会话隔离、双向WebSocket流及语音专用遥测功能,有效减少延迟并保障安全性。亚马逊指出,这种架构能支持更智能、响应更快的客户语音交互体验。 #亚马逊 #NovaSonic #语音智能体 #AI #云计算 #Bedrock #开发者工具 #实时通信 #人工智能
Kiro CLI 实现跨会话记忆,开发者效率大幅提升
针对现有AI编程助手在不同会话中“失忆”、导致开发者需重复提供上下文的痛点,一种新方案通过集成亚马逊云科技的服务得以解决。该方案利用Amazon Bedrock AgentCore Memory服务,为Kiro CLI命令行工具构建了一个持久化对话记忆系统。 其核心是实现了一个自定义的模型上下文协议(MCP)服务器,作为Kiro CLI与AgentCore Memory之间的桥梁。该服务器允许Kiro的AI代理存储、检索和管理跨会话的对话历史与上下文。方案采用了两阶段检索策略:首先尝试基于语义的搜索进行概念匹配,若未处理完毕则回退到直接的事件级内容匹配,确保对话无论处理进度如何均可被检索。这使得Kiro CLI能够记住用户的偏好、项目详情和工作流,避免在每次新会话中重复输入相同信息,从而显著提升开发者与AI助手协作的效率与体验。 #AI编程助手 #KiroCLI #亚马逊云科技 #Bedrock #对话记忆 #开发效率 #MCP协议 #技术解决方案
针对现有AI编程助手在不同会话中“失忆”、导致开发者需重复提供上下文的痛点,一种新方案通过集成亚马逊云科技的服务得以解决。该方案利用Amazon Bedrock AgentCore Memory服务,为Kiro CLI命令行工具构建了一个持久化对话记忆系统。 其核心是实现了一个自定义的模型上下文协议(MCP)服务器,作为Kiro CLI与AgentCore Memory之间的桥梁。该服务器允许Kiro的AI代理存储、检索和管理跨会话的对话历史与上下文。方案采用了两阶段检索策略:首先尝试基于语义的搜索进行概念匹配,若未处理完毕则回退到直接的事件级内容匹配,确保对话无论处理进度如何均可被检索。这使得Kiro CLI能够记住用户的偏好、项目详情和工作流,避免在每次新会话中重复输入相同信息,从而显著提升开发者与AI助手协作的效率与体验。 #AI编程助手 #KiroCLI #亚马逊云科技 #Bedrock #对话记忆 #开发效率 #MCP协议 #技术解决方案
亚马逊 SageMaker 功能存储发布三大新特性,简化机器学习特征管道并降低数据成本
为应对机器学习模型从实验到生产规模化过程中面临的数据安全与存储成本挑战,亚马逊云科技宣布为其全托管服务 SageMaker 功能存储推出三项新能力。企业团队常遇到的问题包括:为新增特征组配置数据访问权限过于繁琐,以及高频流式数据写入导致 Apache Iceberg 元数据快速膨胀,从而产生意外的存储费用。例如,某零售分析团队发现其基于 Iceberg 的离线存储在不到一年内积累了超过 50TB 的元数据文件,带来了高昂的 S3 费用。新功能通过在 SageMaker Python SDK v3.8.0 中引入 `LakeFormationConfig` 和 `IcebergProperties` 参数,实现了在特征组创建时自动设置 AWS Lake Formation 的细粒度访问控制,并配置 Iceberg 元数据的生命周期策略以管理存储成本,从而显著简化运维流程并使开销更可预测。 #亚马逊云科技 #AWS #SageMaker #机器学习 #数据管理 #AI #特征存储 #ApacheIceberg
为应对机器学习模型从实验到生产规模化过程中面临的数据安全与存储成本挑战,亚马逊云科技宣布为其全托管服务 SageMaker 功能存储推出三项新能力。企业团队常遇到的问题包括:为新增特征组配置数据访问权限过于繁琐,以及高频流式数据写入导致 Apache Iceberg 元数据快速膨胀,从而产生意外的存储费用。例如,某零售分析团队发现其基于 Iceberg 的离线存储在不到一年内积累了超过 50TB 的元数据文件,带来了高昂的 S3 费用。新功能通过在 SageMaker Python SDK v3.8.0 中引入 `LakeFormationConfig` 和 `IcebergProperties` 参数,实现了在特征组创建时自动设置 AWS Lake Formation 的细粒度访问控制,并配置 Iceberg 元数据的生命周期策略以管理存储成本,从而显著简化运维流程并使开销更可预测。 #亚马逊云科技 #AWS #SageMaker #机器学习 #数据管理 #AI #特征存储 #ApacheIceberg
亚马逊 Bedrock 实现程序化工具调用,大幅提升大模型交互效率
传统上,大语言模型与外部工具交互时,每次工具调用都需返回模型进行推理,导致多轮往返,增加延迟与 token 消耗。程序化工具调用(PTC)通过模型一次性生成代码,在沙箱环境中并行执行多个工具调用,仅将最终结果返回模型,从而显著优化性能。在 Amazon Bedrock 上,PTC 可通过自托管 Docker 沙箱、托管代码解释器或 Anthropic SDK 代理路径实现,适用于大数据处理、精确计算与隐私敏感场景。此方法能减少冗余计算,提升工作流效率,推动大模型在企业级应用中的落地。 #AmazonBedrock #程序化工具调用 #大语言模型 #AI #云计算 #机器学习 #科技新闻
传统上,大语言模型与外部工具交互时,每次工具调用都需返回模型进行推理,导致多轮往返,增加延迟与 token 消耗。程序化工具调用(PTC)通过模型一次性生成代码,在沙箱环境中并行执行多个工具调用,仅将最终结果返回模型,从而显著优化性能。在 Amazon Bedrock 上,PTC 可通过自托管 Docker 沙箱、托管代码解释器或 Anthropic SDK 代理路径实现,适用于大数据处理、精确计算与隐私敏感场景。此方法能减少冗余计算,提升工作流效率,推动大模型在企业级应用中的落地。 #AmazonBedrock #程序化工具调用 #大语言模型 #AI #云计算 #机器学习 #科技新闻