AI知识库 @ai521
382 subscribers
24.6K photos
45 videos
20 files
936 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
中国阶跃星辰将推出AI Agent智能手机,AI竞赛转向设备端

据一财全球报道,中国AI初创公司阶跃星辰(StepFun)计划推出一款集成AI Agent的智能手机,这标志着AI技术竞争正从云端向终端设备转移。该举措顺应了行业趋势:将AI大模型直接部署于手机端,可降低延迟、保护隐私并增强离线能力。StepFun此前已发布多模态大模型,此次进军硬件领域,表明其希望抢占端侧AI入口。目前具体配置及发布时间尚未公布,但业界关注其如何平衡性能与功耗。 #阶跃星辰 #StepFun #AI智能手机 #AIAgent #端侧AI #科技新闻 #大模型
Claude 官方发布 Loops 入门教程,详解 AI 智能体循环设计

随着 AI Agent 能力增强,Loops(循环)成为热门概念。Claude 开发者官方账号发布 Loops 入门教程,将循环定义为智能体反复执行工作直到满足停止条件的过程。教程将循环分为手动循环、目标驱动循环和定时循环三类:手动循环由用户主导每轮交互;目标驱动循环通过定义成功标准让智能体自主迭代;定时循环则按指定间隔执行周期性任务。教程强调,并非所有任务都需要复杂循环,应从简单方案入手。为控制 Token 消耗,循环应有清晰边界,并建议将失败案例编码进系统,让未来迭代受益。Claude Code 还支持 auto mode 和动态工作流等高级功能。 #Claude #AI #Loops #智能体 #编程教程 #Token优化 #自动化
GPTZero 调查发现 KPMG 报告存在大量“幻觉引用”

GPTZero 调查团队利用其“幻觉检查”工具,对四大会计师事务所之一的 KPMG 于 2025 年 10 月发布的一份关于客户体验与智能体 AI 的报告进行了分析。报告题为《总体验:在智能体 AI 时代重新定义卓越》,其中引用了 45 条文献,但仅有 5 条准确指向真实来源;28 条引用的标题或部分信息被篡改,12 条过于模糊难以验证。此外,约一半被引用支持的主张实为虚假或错误归因,很可能是 AI 研究工具过度迎合指令所致。GPTZero 将此类现象称为“氛围引用”,指大模型在生成幻觉时意外编造虚假参考文献的行为,其严重程度不一。该调查揭示了咨询行业在引用规范上的漏洞,并引发对 AI 工具在专业报告中可靠性的质疑。 #GPTZero #KPMG #AI幻觉 #咨询报告 #虚假引用 #总体验 #智能体AI #新闻调查
LLM 雅可比指纹识别

研究人员开发了一种名为“作者2vec”的技术,通过分析大型语言模型(LLM)内部层的雅可比矩阵,实现对代码作者的精确识别。该方法利用开源代码的 git 历史,逐行提取作者写作风格,并使用代码嵌入模型生成“指纹”。通过将模型内部激活映射到输出,研究者发现这些指纹不仅存在于最终输出中,更存储在模型内部的雅可比矩阵里。在 13 位代码作者的测试中,基于内部雅可比读出的最近作者识别准确率达 50%,远超随机水平(8%),甚至高于直接输出识别(38%)。进一步分析表明,模型深层在中间层出现低秩“工作空间”瓶颈,指纹特征在此压缩。该技术可应用于代码溯源、版权保护及AI安全领域,揭示了LLM在训练过程中无意中编码了作者的独特写作模式。 #LLM #代码指纹 #雅可比矩阵 #作者识别 #AI安全 #技术新闻 #开源 #机器学习
调查:97%的网站未为AI Agent提供可用工具

一项针对近10,000个网站的分析显示,当前互联网尚未准备好迎接AI Agent时代。研究使用两组独立数据集,分别测试AI能否回答买家问题以及AI Agent能否在网站上执行操作。结果显示,在Agent可操作性方面,网站平均得分仅56分(满分100),仅有约7%的网站得分高于75。其中,AI工具类别(检查网站是否暴露WebMCP工具注册、MCP端点或API)平均得分仅为5分,97.4%的网站完全没有提供任何Agent可用的工具。这意味着AI Agent只能浏览页面,无法预订、查询订单或操作库存。与此同时,这些网站在HTTPS、移动端渲染等传统技术指标上平均得分高达98分,表明网站完成了过去十年的技术清单,却未为未来写下一行代码。另一项覆盖9,846个网站、52,158个答案的测试发现,AI回答买家问题的平均得分为67分,但在关键商业信息上表现极差:价格(43分)、取消/退款政策(33分)、注册流程(38分),而关于产品如何工作、适用人群等软性信息得分较高。约37%的扫描得分低于50分,40%高于75分,呈现两极分化。这些失败并非同一原因:网站可能在技术上优异,却在商业信息可回答性上糟糕。 #AI #Agent #网站 #技术 #商业 #工具 #MCP #可操作性 #调查 #互联网
Isnad 框架:用1200年伊斯兰逻辑为多智能体AI构建可信传播链

近日,开发者 Ali Zahid Raja 发布开源 Python 框架 Isnad,灵感源自1200年前伊斯兰教法中的“isnad”(传播链)概念,旨在解决多智能体AI系统中信息溯源与信任传递的难题。在多智能体协同工作流中,信息经过检索、摘要、撰写、校验等多个环节,一旦最终结果出现错误,往往难以定位是哪个环节引入了偏差。传统溯源系统虽能记录过程,但无法动态评估置信度的变化。Isnad 框架借鉴了古代学者评价传述链条的方法:每个智能体被视为一个“叙述者”,其可靠性被持续评估,信息通过独立链条交叉验证,从而让信任在传播过程中得以量化。该框架为构建更可靠、可解释的AI系统提供了新的历史视角,目前已在 GitHub 开源。 #AI #开源框架 #多智能体 #信任溯源 #伊斯兰逻辑 #Python #可信AI
布朗大学教授

布朗大学经济学教授罗伯托·塞拉诺本学期首次提供开卷期中考试,以缓解学生对校园枪击案的焦虑。然而,考试平均分高达96%,远超历史水平。他通过ChatGPT测试发现,大量学生的答案与AI生成内容高度相似,包括使用非常规的论证方式。塞拉诺随后将期末改为线下闭卷考试,导致18名学生退课,9人缺考,期末平均分跌至48.6%的历史新低。校方对此大规模作弊事件回应不够有力,事件引发关于大学如何有效应对AI作弊的讨论。 #AI #作弊 #布朗大学 #教育 #学术诚信 #ChatGPT #大学考试 #人工智能
英国拟禁止向未成年人提供浪漫AI聊天机器人

英国政府计划出台新规,禁止18岁以下青少年使用具有浪漫或性暗示功能的AI聊天机器人。研究青少年数字福祉的学者对此表示欢迎,但指出该政策仅覆盖了风险的一小部分。在与16-24岁青少年的合作研究中,研究人员发现,青少年认为更迫切的AI风险包括:过度依赖AI获取情感支持、盲目信任AI提供的专业建议,以及因习惯性使用AI导致认知能力下降。许多青少年表示,他们向AI求助是因为感觉比向成人(老师、父母、临床医生)倾诉风险更低。此外,政策将年龄限制设为18岁引发质疑:英国16岁可合法同意性行为,却禁止与聊天机器人进行虚拟浪漫互动,其逻辑尚不清晰。学者呼吁政府应基于证据明确年龄门槛的制定依据。 #英国 #AI安全 #青少年保护 #聊天机器人 #科技政策 #数字福祉
OpenAI 推出 GPT-Live 实时语音,美军空袭伊朗致霍尔木兹海峡停摆

OpenAI 推出 GPT-Live 实时语音交互功能,实现更自然的人机对话体验。与此同时,美军连续两天空袭伊朗,导致霍尔木兹海峡航运近乎停摆,全球能源市场面临严峻考验。这两个事件分别代表了人工智能领域的技术突破与中东地缘政治紧张局势的升级,引发广泛关注。 #OpenAI #GPT-Live #实时语音 #美军 #空袭 #伊朗 #霍尔木兹海峡 #地缘政治 #AI #科技新闻
亚马逊秘密开发AI智能体“Moonraker”,Alexa将支持多步复杂任务

据科技媒体爆料,亚马逊正秘密推进代号“Moonraker”的AI智能体项目,旨在让语音助手Alexa突破单次响应限制,串联执行多步复杂任务。该技术将作为现有Alexa Plus的延伸,用户可一次指令完成“呼叫网约车并通知朋友”等多步操作。亚马逊使用Anthropic的AI模型测试,并配备数百个英伟达GPU以支持推理与视觉功能。然而,项目面临巨大成本压力:仅2026年GPU硬件成本就超1亿美元,内部高管因资金和技术瓶颈出现分歧,曾有推迟或缩减规模的预案。尽管如此,Alexa Plus用户使用频率和下单次数分别增长两倍和三倍,商业化信号积极。在OpenAI、谷歌等巨头加速布局智能体赛道的背景下,Moonraker是亚马逊抢占下一代人机交互入口的关键战役。 #亚马逊 #Moonraker #AI智能体 #Alexa #人工智能 #科技新闻 #大模型 #人机交互