AI知识库 @ai521
378 subscribers
24.5K photos
45 videos
20 files
932 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
ACM AI与智能体系统会议2026将在圣何塞举办

ACM CAIS 2026将于5月26日至29日在美国加州圣何塞举行,该会议致力于推动复合式AI架构、优化及部署领域的严谨、可复现研究。会议包括一天的工作坊与教程,随后三天展示经过同行评议的研究论文、系统演示及主旨演讲。议题涵盖智能体技能、智能体软件工程、强化学习环境等广泛领域。 会议邀请了多位业界领袖发表演讲,包括Databricks联合创始人、Anthropic技术员工、斯坦福大学教授等。会议论文与演示来自全球115多家学术与工业机构。此外,CAIS 2026已与AI工程师世界博览会建立合作,部分入选论文将获得在两个会议场合进行展示的机会。 #AI会议 #智能体系统 #ACM #CAIS2026 #机器学习 #人工智能 #学术会议 #技术前沿
DeepSeek研究员与AI合著论文,展现科研智能体变革潜力

DeepSeek研究员陈德里与两个AI系统DeepSeek-V4-Pro和GPT-合作,完成了一篇题为《从副驾驶到同事:自主科研智能体调查》的论文。该论文经过6轮迭代,初稿耗时76分钟,总耗时6天,消耗约64.8万tokens。陈德里通过这一实验指出,Code Agent正加速科研进程,过去需一个月的工作现在仅需不到2小时思考,可能导致计算机科学论文“疯狂通胀”。论文系统分析了17个主流自主科研智能体系统,覆盖超过95篇参考文献,提出了从L1到L5的自主层级分类,并总结了单智能体循环、多智能体协作等架构。同时,它直面认知循环陷阱、上下文限制等挑战,揭示AI正从研究工具快速演变为研究者本身。 #AI #科研智能体 #论文 #DeepSeek #科技新闻 #自主AI #计算机科学 #人工智能
新研究框架FML-Bench发布,用于系统评估AI科研智能体策略

近日,一个名为FML-Bench的AI研究智能体策略评估基准在学术预印本平台arXiv上发布。该研究由Qiran Zou等14位作者共同完成,旨在从搜索动态的视角,对AI研究智能体的不同策略进行受控研究。这项工作为系统性地理解和比较自动化科研流程中智能体的行为与效能提供了新的工具和方法。 #AI研究 #智能体 #FMLBench #arXiv #科研工具 #自动化 #人工智能 #科技
支付宝推出全球首个AI代理购物钱包

近日,中国支付宝宣布推出全球首个针对代理购物场景的AI钱包。该产品集成人工智能技术,旨在通过智能代理自动化购物流程,例如根据用户偏好自动选择商品并完成支付,为用户提供更便捷、个性化的购物体验。作为中国领先的移动支付平台,支付宝此次创新展示了其在金融科技领域的技术实力,不仅可能提升自身市场竞争力,还有望推动AI在消费场景中的广泛应用,对全球电商和支付行业的发展产生积极影响。 #支付宝 #AI钱包 #代理购物 #金融科技 #AI #科技创新 #新闻
DeepSWE 新基准发布,GPT

近日,创业公司 Datacurve 推出名为 DeepSWE 的全新 AI 编程基准测试,挑战现有评估体系。该基准包含 113 个复杂任务,涵盖 91 个开源仓库和五种编程语言,平均需添加 668 行代码,远超现有 SWE-Bench Pro 基准的 120 行规模。在测试中,OpenAI 的 GPT-5.5 以 70% 的得分显著领先,比最近竞争对手高出 16 个百分点,而 Anthropic 的 Claude Opus 和 Google 的 Gemini Pro 等模型表现相近。 Datacurve 指出,现有基准 SWE-Bench Pro 存在系统缺陷,其自动评判系统约三分之一情况下出错,可能误导企业采购、投资和 AI 研发决策。DeepSWE 通过更短的提示和更高的任务复杂度,更真实反映开发者日常工作中 AI 助手的实际表现。这一发现将推动行业重新审视评估标准,对 AI 模型选型和产业发展产生深远影响。 #DeepSWE #GPT5.5 #AI编程 #基准测试 #OpenAI #科技新闻 #人工智能 #开发者工具
AI代理性能差异源于词汇选择而非用户意图

一位同事发现,AI代理在作者使用时能路由到更丰富的工作流程,而在自己使用时效果较差。经调查,问题并非用户意图不同,而是词汇选择的差异。该AI代理的路由机制依赖于关键词匹配:特定词汇如“thorough”或“with tests”能触发额外的增强功能,例如并行代码审查或测试驱动开发管道。同事作为非母语者,使用直接、正确的英语,但未命中这些关键词,导致代理路由到较慢路径或提供较少功能。这揭示了AI系统中的语言偏见,相同需求因词汇不同而得到不同结果,可能对非母语用户造成不公。作者指出,这种机制性难题目前尚无完美解决方案。 #AI #人工智能 #语言偏见 #科技新闻 #机器学习 #语言处理 #新闻事件
FBI探员揭秘识别AI色情内容发布者的便捷手段

据报道,美国联邦调查局(FBI)近期依据《Take It Down Act》法案,成功逮捕两名非法发布和销售非自愿性化深度伪造内容的男性。FBI探员Christopher Powell在宣誓书中披露,调查人员通过直接访问色情网站并搜索“#AI #Deepfakes”等标签定位嫌疑人。其中一名嫌疑人Hernandez的识别过程凸显了数字追踪的高效性:地理位置数据、关联的PayPal账户、匹配的IP地址,以及他在多个平台重复使用“Ryan”昵称的证据,共同帮助警方快速锁定其身份。尽管Hernandez曾试图通过注册别名隐匿活动,但最终未能逃脱法网。这一案例表明,执法机构正利用技术手段有效打击网络犯罪,保护个人免受AI生成非自愿内容的侵害。 #FBI #AI #深度伪造 #网络犯罪 #法律 #科技新闻 #隐私安全 #TakeItDownAct