AI知识库 @ai521
380 subscribers
24.5K photos
45 videos
20 files
934 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
亚马逊SageMaker AI新增OpenAI兼容API支持

亚马逊近日宣布,其SageMaker AI服务正式新增对OpenAI兼容API的支持。用户现在只需更改端点URL,即可使用OpenAI SDK、LangChain或Strands Agents等工具直接调用SageMaker AI上托管的模型,无需自定义客户端或代码重写。SageMaker AI端点暴露了/openai/v1路径,支持Chat Completions请求和流式响应,并通过时间限制的bearer令牌进行认证。此举简化了AI模型部署和集成流程,允许用户在单一端点托管多个模型(如Llama、Mistral等),并通过统一接口访问,提升了开发效率和灵活性。 #亚马逊 #SageMaker #OpenAI #AI #API #云服务 #机器学习 #开发工具
SpaceX 引用 S

近期科技新闻报道,SpaceX 引用了 S-1 文件,具体细节虽未明确,但可能涉及公司新技术或战略规划,引发行业关注。与此同时,AI 领域进展显著:Datasette Agent 于 2026 年 5 月 21 日发布,为数据集管理提供创新工具;Google 的 Gemini 3.5 Flash 尽管成本更高,但公司计划将其广泛应用于各种场景,该消息于 5 月 19 日公布。此外,过去六个月大型语言模型的发展在五分钟内被总结,突显了 AI 技术的快速迭代。这些事件共同展示了科技行业的活跃与创新趋势。 #SpaceX #S1 #科技新闻 #AI #DatasetteAgent #Gemini #LLM #Google #技术创新
Strands Evals SDK推出多模态评估工具,解决AI图像任务准确性难题

亚马逊网络服务(AWS)为其开发工具包Strands Evals SDK引入了四个新的多模态大型语言模型(MLLM)作为评判工具,专门用于评估图像到文本生成任务的质量。传统的纯文本评估器无法验证模型输出是否准确基于源图像,而随着多模态企业软件需求激增,这一缺陷导致开发者陷入昂贵的人工审核与不可靠的自动评估两难境地。 新发布的四个评估器分别针对整体质量、正确性、忠实度和指令遵循度进行评分。它们将源图像、查询及模型回复一同发送给多模态评判模型,从而基于视觉内容给出评分和推理依据。这些工具可直接替换现有流程中的纯文本评估器,并集成到持续集成流程中,自动检测视觉幻觉、事实错误和指令违反等问题,显著提升了多模态应用(如发票解析、图表分析、屏幕摘要)的评估可靠性与调试效率。 #多模态评估 #AI工具 #图像理解 #大语言模型 #开发者工具 #自动化测试 #AWS #计算机视觉
谷歌Gemini 3.5 Flash发布,成本上升但计划全面应用

在2026年5月的大语言模型(LLM)领域,谷歌推出了Gemini 3.5 Flash模型,尽管其价格较前代有所提升,但公司宣布计划将该模型广泛应用于各项产品和服务中。与此同时,业界对大语言模型的速度性能进行了深入探讨,特别是每秒处理10个令牌的实际表现成为焦点。此外,相关文章如Datasette Agent的更新和过去六个月LLM领域的快速变化,进一步凸显了技术迭代的加速。这些进展不仅反映了AI模型在成本与性能间的权衡,还可能推动商业化应用的扩展,促使行业更加关注效率优化和战略部署。 #谷歌 #Gemini #大语言模型 #AI #科技新闻 #人工智能 #速度测试 #商业化
亚马逊SageMaker AI与vLLM合作,赋能实时语音应用开发

实时语音代理、直播字幕和客服分析等应用均依赖于低延迟的语音转文字技术,这要求音频流输入与转录结果同步返回。传统请求-响应推理需等待完整音频接收后才开始处理,延迟过高,无法满足实时需求。自2025年11月起,亚马逊SageMaker AI将引入双向流式传输功能,支持客户端与模型容器间连续数据交换;同时,vLLM通过其Realtime API基于WebSocket实现实时音频转录。本文结合这两项技术,展示了如何将Mistral AI的紧凑型实时语音模型Voxtral-Mini-4B-Realtime-2602部署到SageMaker AI端点,利用vLLM容器构建完全托管的实时语音转文字服务。该方案通过协议桥接和健康管理,消除了开发者自建流式基础设施或维护GPU服务器的负担,提供从开源模型到生产级服务的端到端解决方案。 #亚马逊 #SageMakerAI #vLLM #实时语音转文字 #AI #科技新闻 #云计算 #大模型 #语音技术
Google I/O大会发布Gemini Spark与Antigravity AI技术

在2026年5月举行的Google I/O开发者大会上,Google重点展示了其
绿色钢铁初创公司Boston Metal转向关键金属生产并获融资

绿色钢铁初创公司Boston Metal近期获得7500万美元融资,将业务重点从清洁钢铁生产转向铌、钽、镍等关键金属。该公司原以减少钢铁行业碳排放闻名,该行业占全球温室气体排放的8%。其核心技术熔融氧化物电解通过高温电流分离金属,巴西子公司正利用该技术建设商业设施,但此前因工业事故导致现金流问题和裁员。新融资将支持巴西工厂重启,预计2026年9月投入运行,并推动未来在美国生产铬等关键金属项目。公司总融资额已超过5亿美元,此举旨在适应工业脱碳支持减弱的环境并提升生存能力。 #绿色科技 #金属生产 #初创企业 #融资 #工业脱碳 #关键金属 #BostonMetal #环保技术
Google 拟全面部署成本更高的 Gemini 3.5 Flash 模型

根据近期报道,Google 宣布计划在其所有产品中全面采用 Gemini 3.5 Flash 大语言模型,尽管该模型的运营成本较前代版本有所上升。这一决策旨在利用模型在推理速度和性能上的提升,以优化用户体验和产品功能。同时,行业对过去六个月大语言模型的发展进行了简要回顾,突显了技术进步的快速节奏和市场动态。这些举措反映出 AI 领域持续创新的趋势,企业可能为更先进的能力支付溢价,推动整个生态向高效能但高成本的方向演进。 #Google #Gemini #AI #LLM #大模型 #科技新闻 #人工智能
谷歌发布Gemini 3.5 Flash模型,价格飙升但广泛应用

在谷歌I/O大会上,谷歌正式推出Gemini 3.5 Flash模型,该模型跳过预览阶段直接进入一般可用性,并被集成到谷歌的众多关键免费产品中。技术方面,其知识截止日期为2025年1月,支持高达104万输入token和6.5万输出token,同时谷歌推出了测试版的Interactions API。然而,模型价格显著上涨,达到前代Flash模型的3至6倍,接近Gemini 3.1 Pro版本的定价。行业趋势显示,如OpenAI和Anthropic等AI实验室也在提高模型价格,正在测试API客户的价格承受能力。尽管成本增加,谷歌仍大规模部署该模型,体现了其战略意图。基准测试表明,运行Gemini 3.5 Flash的费用较高,例如生成一个简单SVG示例就花费约13美分。 #谷歌 #Gemini #AI #大模型 #科技新闻 #价格上涨 #模型发布 #人工智能
大模型成本计算工具 datasette-llm-accountant 发布 0.1a4 测试版

专注于数据分析的 Datasette 生态系统近日推出了新工具的测试版本。名为 datasette-llm-accountant 的项目发布了其 0.1 alpha 第四版。该项目旨在帮助用户追踪和计算在使用大语言模型过程中的相关成本。此次发布的版本为早期测试版,具体支持的模型和功能细节有待进一步公布。该项目的动态与近期大模型领域的快速发展密切相关,旨在为开发者和使用者提供更精细的用量与成本管理工具。 #大模型 #LLM #数据分析 #Datasette #开源工具 #软件开发 #人工智能
亚马逊推出语音智能体构建方案,支持多智能体与工具调用

亚马逊发布基于Nova Sonic语音基础模型的可扩展语音智能体设计模式,旨在帮助企业构建低延迟、高可靠的实时语音交互系统。该方案整合了Amazon Nova Sonic(语音对话模型)、Amazon Bedrock AgentCore Runtime(无服务器智能体运行时)和开源框架Strands Agents,通过工具驱动型智能体、子智能体代理工具调用以及会话分段等架构,将大型助手分解为模块化、可重用的组件。 这些设计模式允许开发者通过AgentCore Gateway将业务逻辑封装为可调用的工具,由语音模型直接选择调用,无需中间推理层。该运行时环境提供微虚拟机级会话隔离、双向WebSocket流及语音专用遥测功能,有效减少延迟并保障安全性。亚马逊指出,这种架构能支持更智能、响应更快的客户语音交互体验。 #亚马逊 #NovaSonic #语音智能体 #AI #云计算 #Bedrock #开发者工具 #实时通信 #人工智能
Kiro CLI 实现跨会话记忆,开发者效率大幅提升

针对现有AI编程助手在不同会话中“失忆”、导致开发者需重复提供上下文的痛点,一种新方案通过集成亚马逊云科技的服务得以解决。该方案利用Amazon Bedrock AgentCore Memory服务,为Kiro CLI命令行工具构建了一个持久化对话记忆系统。 其核心是实现了一个自定义的模型上下文协议(MCP)服务器,作为Kiro CLI与AgentCore Memory之间的桥梁。该服务器允许Kiro的AI代理存储、检索和管理跨会话的对话历史与上下文。方案采用了两阶段检索策略:首先尝试基于语义的搜索进行概念匹配,若未处理完毕则回退到直接的事件级内容匹配,确保对话无论处理进度如何均可被检索。这使得Kiro CLI能够记住用户的偏好、项目详情和工作流,避免在每次新会话中重复输入相同信息,从而显著提升开发者与AI助手协作的效率与体验。 #AI编程助手 #KiroCLI #亚马逊云科技 #Bedrock #对话记忆 #开发效率 #MCP协议 #技术解决方案
亚马逊 SageMaker 功能存储发布三大新特性,简化机器学习特征管道并降低数据成本

为应对机器学习模型从实验到生产规模化过程中面临的数据安全与存储成本挑战,亚马逊云科技宣布为其全托管服务 SageMaker 功能存储推出三项新能力。企业团队常遇到的问题包括:为新增特征组配置数据访问权限过于繁琐,以及高频流式数据写入导致 Apache Iceberg 元数据快速膨胀,从而产生意外的存储费用。例如,某零售分析团队发现其基于 Iceberg 的离线存储在不到一年内积累了超过 50TB 的元数据文件,带来了高昂的 S3 费用。新功能通过在 SageMaker Python SDK v3.8.0 中引入 `LakeFormationConfig` 和 `IcebergProperties` 参数,实现了在特征组创建时自动设置 AWS Lake Formation 的细粒度访问控制,并配置 Iceberg 元数据的生命周期策略以管理存储成本,从而显著简化运维流程并使开销更可预测。 #亚马逊云科技 #AWS #SageMaker #机器学习 #数据管理 #AI #特征存储 #ApacheIceberg