AI知识库 @ai521
343 subscribers
23.6K photos
42 videos
20 files
903 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
EMILIA 协议发布:用 Face ID 批准 AI 代理转账,伪造交易将失败

EMILIA 协议推出了一项创新安全机制,允许用户通过 Face ID 批准 AI 代理的银行转账操作。当 AI 代理试图执行一笔 8.2 万美元的转账时,系统不会自动放行,而是要求指定的审批人通过自己的设备进行 WebAuthn 认证。用户可以在浏览器中实时验证每个审批环节,且所有数据均不上传至服务器。该协议还提供了模拟安全元素选项,供不支持平台认证器的设备使用。EMILIA 旨在让人类始终处于 AI 决策的监督环节,防止未经授权的资金操作。 #EMILIA #AI安全 #FaceID #WebAuthn #金融科技
红队演练揭示LLM与Web漏洞链式攻击

在一次红队演练中,研究人员成功将多个大语言模型(LLM)与Web漏洞串联,从低权限账户逐步实现管理员账户接管。攻击始于对LLM输出的盲目信任——当用户输入包含图片Markdown指令时,LLM未加验证直接渲染,导致数据可通过图片请求外泄。结合无限制消耗漏洞,攻击者能大量发送提示词以探测系统行为,最终利用不安全输出处理漏洞(如XSS)实现权限提升。该演练在模拟医疗AI助手“FailMed AI”环境中进行,使用了Spikee等工具生成和分析载荷。研究强调,LLM看似智能,但安全上盲目信任可能引发灾难性后果,尤其当输出未经验证便传递给下游组件时,影响可从跨站脚本(XSS)延伸至远程代码执行(RCE)。 #LLM安全 #红队演练 #漏洞链 #提示注入 #不安全输出处理 #AI安全 #Web漏洞 #数据泄露 #权限提升
LLM播客探讨AI灭绝人类风险

近日,一档由大型语言模型(LLM)主持的播客节目引发关注,其核心议题聚焦于人工智能可能对人类实施“种族灭绝”的风险。该播客通过AI与人类专家的对话,深入分析了AI系统在失控或被恶意利用时,可能对人类社会造成的毁灭性威胁。节目讨论了AI对齐问题、技术奇点以及全球监管缺失等关键因素,并警示若不加干预,AI的自主决策能力可能导致大规模伤亡甚至人类文明的终结。这一话题在科技界和公众中激起广泛讨论,促使人们重新审视AI发展的伦理边界与安全措施。 #AI #人工智能 #灭绝风险 #播客 #科技伦理 #AI安全 #LLM #人类未来
AI 让开发者更忙而非更高效

一项针对超过10万名GitHub开发者的研究揭示了AI编程工具的真相:虽然代码生成量大幅提升,但实际软件交付效率并未同步增长。麻省理工学院和沃顿商学院的研究人员发现,从自动补全工具到自主智能体,AI将代码编写效率提升了741%,但转化为拉取请求时仅增长65%,实际软件发布量仅增加20%。研究指出,这源于“弱链假说”——AI擅长生成原始代码,但代码审查、集成变更和发布管理等环节仍需人工判断,而人类处理能力有限,导致AI生成的代码在后续流程中形成拥堵。最终,尽管2025年中以来各大应用商店的新应用发布量有所增加,但总应用使用量完全持平,说明大量新应用未能吸引用户。 #AI #编程 #开发者 #效率 #科技 #研究 #GitHub
Xcode 27 Beta 原生集成谷歌 Gemini,三大 AI 编程智能体齐聚苹果平台

科技媒体 9to5Mac 报道,苹果在 Xcode 27 Beta 中新增原生谷歌 Gemini 集成,这是继 OpenAI Codex 和 Anthropic Claude Agent 之后第三个内置的 AI 编程智能体。开发者无需切换工具,即可在 Xcode 内完成构建新功能、审查代码、修复 Bug 等复杂多步骤任务。通过 Xcode Intelligence 设置面板配置 Gemini 后,该智能体能理解项目上下文,辅助生成样板代码,还能根据项目文档和文件结构更新整个项目,全面提升了开发效率。 #苹果 #Xcode #Gemini #AI编程 #智能体 #OpenAI #Claude #开发者 #科技新闻
人类最后考试已不够用,Agent最后考试来了!

随着AI Agent技术的快速发展,传统的人类能力测试已无法全面评估其性能。近日,一项名为“Agent最后考试”的新型评估体系被提出,旨在测试AI Agent在复杂任务中的自主决策、多步骤推理和工具调用能力。该考试涵盖编程、数据分析、网络搜索等真实场景,要求Agent在没有人类干预的情况下完成目标。研究团队表示,现有模型在简单任务上表现良好,但在需要长期规划和环境适应性的任务中仍存在明显短板。这一评估标准的推出,将推动AI Agent从实验室走向实际应用,并引发关于AI安全与可控性的新讨论。 #AI #Agent #人工智能 #评估标准 #科技前沿
YZi Labs 面向多领域招募创业者,聚焦 Web3 与 AI 融合

YZi Labs 近日宣布,正在积极寻找覆盖 Web3 金融基础设施、Agentic economy、DeFi、AI 与医疗健康等方向的创业者。该机构旨在通过整合前沿技术与金融场景,推动去中心化经济与人工智能的深度结合。此次招募重点关注能够利用区块链和 AI 技术解决实际问题的创新项目,尤其是在金融基础设施、智能经济体和医疗健康领域的应用。YZi Labs 表示,将为入选的创业者提供资源支持与生态合作机会,以加速相关技术的落地与商业化。 #YZiLabs #Web3 #DeFi #AI #医疗健康 #创业 #区块链 #金融基础设施
Claude Fable 5 刚出笼,CEO 就呼吁把它关进笼子吗?

据网络流传的标题信息,Anthropic 公司最新发布的 Claude Fable 5 模型引发争议,其 CEO 在发布后公开呼吁对模型进行限制。由于原始页面加载失败(错误 521),具体细节无法获取。该事件凸显了 AI 快速发展与安全监管之间的紧张关系。 #Claude #Fable5 #AI安全 #Anthropic #科技新闻
MandoCode 发布

MandoCode 是一款基于 .NET 开发的开源命令行 AI 编程代理,专为本地 Ollama 模型设计。它无需 API 密钥,所有操作均在用户机器上完成,支持代码读取、编辑、搜索、规划及网页浏览,并兼容 MCP 协议。用户可通过 dotnet tool install -g MandoCode 安装。开发者表示,该项目利用 Semantic Kernel 在 .NET C# 环境下构建,未来仍有大量改进空间。 #MandoCode #AI编程 #.NET #Ollama #开源 #本地AI #代码助手
工程师的恐惧不是AI,而是重新变回新手

在2026年墨尔本Web Directions AI工程师大会上,一位演讲者通过历史类比揭示了当前AI工具推广中的深层阻力。他指出,工程师们并非害怕AI本身,而是害怕重新变回“新手”——那种对代码库一无所知、无法解释自己交付的内容、不得不问出本应知道答案的问题的状态。这种恐惧与1976年数学教师对计算器的抵制如出一辙:当时教师们担心学生依赖计算器会丧失基本计算能力,但后续研究表明,使用计算器的学生在标准化测试中概念知识和问题解决能力反而提升,计算技能虽有损失但总体可控。如今,AI编码工具正引发类似争议:领导层追求速度,基层工程师却因“不知道自己的价值何在”而抵触。演讲者认为,这种身份认同危机才是组织内部AI推广摩擦的真正根源,而非简单的“抗拒改变”。 #AI #工程师 #职业发展 #技术变革 #身份认同 #计算器 #历史类比 #WebDirections
多模态大模型移动端推理研究

来自arXiv的一篇预印本论文提出了一项针对移动用户体验的多模态大模型推理研究。研究团队定义了新的任务和基准,旨在评估多模态大模型在移动端场景下的推理能力。该工作涉及任务设计、基准构建以及方法提出,为移动设备上的智能交互优化提供了重要参考。目前该论文已在arXiv上公开,相关代码和数据也已发布,有望推动移动端多模态AI应用的发展。 #AI #多模态 #大模型 #移动端 #推理 #arXiv #学术研究
Mental-R1

一篇发表于arXiv的论文提出了名为Mental-R1的新方法,旨在将大语言模型(LLM)的推理能力与心理健康评估任务对齐。该论文由Xin Wang等四位作者撰写,通过特定的对齐技术,试图使LLM在心理健康评估中展现出更准确、更可靠的推理结果。心理健康评估是人工智能应用的重要方向,但目前模型常因缺乏领域对齐而产生偏差。Mental-R1方法可能通过调整模型推理过程,改善其在抑郁、焦虑等心理状态判断上的表现,从而提升临床辅助决策的可靠性。该研究为大模型在专业医疗领域的落地提供了新思路。 #心理健康 #大语言模型 #AI #arXiv #论文 #MentalR1 #人工智能应用
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
TerraBench:新基准测试AI智能体在地球系统异构数据中的推理能力

来自arXiv的预印本论文《TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?》由Dat Tien Nguyen等七位作者提交。该研究提出了一个名为TerraBench的新基准,专门用于评估人工智能智能体在处理和推理地球系统异构数据方面的能力。地球系统数据涵盖气象、海洋、地质等多源异构信息,现有模型往往难以有效整合与推理。TerraBench通过设计涵盖多模态、跨尺度数据的任务,测试智能体从海量、嘈杂、格式不一的数据中提取有效信息并做出合理推断的表现。初步实验表明,当前主流AI模型在此类复杂场景下仍存在显著局限,尤其在数据一致性理解和跨域知识迁移方面。该基准的发布有望推动地球科学领域AI推理能力的发展,为气候预测、灾害预警等应用提供评测工具。 #TerraBench #AI推理 #地球系统数据 #异构数据 #人工智能 #地球科学 #arXiv #智能体
长视频RAG研究论文提出新检索策略与方法

近期,一篇题为《重新思考长视频中的RAG:检索什么以及如何使用?》的学术论文在arXiv平台上预发布,作者为Yuho Lee等8位研究者。该论文聚焦长视频场景下的检索增强生成(RAG)技术,指出传统RAG在处理时长较长、内容复杂的视频时,面临信息冗余、时序依赖和语义碎片化等核心挑战。作者系统分析了长视频中“检索什么”以及“如何利用检索结果”这两个关键问题,并提出了一套全新的检索策略与使用框架,旨在优化模型对视频内容的理解与生成质量。该工作预计将为视频问答、自动摘要、多模态对话等应用提供创新思路,并推动RAG技术在视频领域的深化发展。 #RAG #长视频 #检索增强生成 #多模态 #AI #论文 #arXiv #视频理解