AI知识库 @ai521
317 subscribers
21.9K photos
42 videos
19 files
839 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
更多代理是否更有效?LLM代理工作流受控评估研究发布

一篇题为《更多代理是否更有帮助?受控与协议对齐的LLM代理工作流评估》的学术论文近日在arXiv上提交。该研究由Yuhang Fu等六位作者完成,旨在通过受控实验和协议对齐方法,系统评估大型语言模型(LLM)在代理工作流中增加代理数量对任务性能的影响。研究设计注重实验条件的严格控制和协议一致性,为多代理协作场景提供量化依据。论文已提供PDF、HTML及TeX源码,并开放相关代码与数据链接,供学界进一步验证。该工作对理解LLM代理系统的可扩展性和效率具有重要参考价值。 #LLM #AI代理 #工作流评估 #学术论文 #arXiv #多代理系统
AI公司转向衬线字体以营造人性化形象

随着公众对人工智能无处不在的抵制加剧,人们开始识别并拒绝AI的痕迹。继破折号和“三法则”之后,衬线字体成为新的标志。设计师指出,AI原生公司如Anthropic的Claude、Perplexity等纷纷采用衬线字体,试图传递温暖和人性化。衬线字体源于书法,带有学术和权威感,能建立信任。设计师Vadgama称之为“衬线复兴”,认为这是AI公司为了消除用户的恐惧,营造“我们是AI,但由真人制作”的印象。然而,这种策略也被批评为“品味垃圾”,试图让AI设计显得表面高雅。 #AI #衬线字体 #设计 #人性化 #科技 #字体 #品牌信任 #Perplexity #Claude
PerceptUI: 用 LLM 代理作为人机对齐的合成用户评估界面体验

一项新研究提出名为 PerceptUI 的框架,利用大语言模型(LLM)代理作为与人类行为对齐的合成用户,用于自动化 UI/UX 评估。该方法通过模拟真实用户的交互模式,帮助设计师在开发阶段快速发现界面可用性问题,减少对大规模人工测试的依赖。初步实验表明,PerceptUI 在多个评估指标上接近人类判断水平,有望提升界面设计迭代效率。 #LLM #UIUX #人机交互 #AI评估 #合成用户 #arXiv #人工智能
持续学习基准问世:评估前沿AI在真实世界有状态环境中的表现

一篇来自arXiv的论文提出了名为“Continual Learning Bench”的新型基准,旨在评估前沿AI系统在真实世界有状态环境中的持续学习能力。传统基准多聚焦于静态任务,而该基准模拟了动态、交互式的场景,要求AI在状态不断变化的环境中持续适应和学习。研究团队通过机器人控制、对话系统等多项真实世界任务,对当前最先进的AI模型进行了测试,揭示了它们在长期交互中性能退化的关键问题。这一基准为AI系统的实用性、鲁棒性和安全性提供了全新评估维度,对推动持续学习研究及AI在复杂环境中的部署具有深远意义。 #AI #持续学习 #基准测试 #机器学习 #论文 #前沿AI #有状态环境 #评估 #arXiv
AI低质内容已渗透老年人家庭

随着AI生成内容的泛滥,大量低质量、误导性或虚假的“AI垃圾”正悄然侵入老年人的日常生活。这些内容常以健康建议、虚假新闻或诈骗信息的形式出现,借助社交媒体和短视频平台迅速传播。老年人由于对新技术识别能力较弱,容易成为AI生成内容的主要受害者,面临信息误导、财产损失甚至情感欺骗的风险。专家呼吁家庭和社会加强对老年人的数字素养教育,同时敦促平台承担内容审核责任。 #AI垃圾 #老年人 #信息误导 #网络安全 #数字素养 #虚假内容 #诈骗风险 #社交媒体 #AI伦理 #家庭关怀
研究重新评估AI生成测试对LLM软件工程代理的价值

近日,一项题为《重新思考由代理生成的测试对基于LLM的软件工程代理的价值》的研究在arXiv上发布。该研究由Zhi Chen等七位作者共同完成,旨在深入探讨大型语言模型(LLM)驱动的软件工程代理所自动生成的测试用例的实际效用。研究指出,当前广泛使用的由代理自生成测试的方法可能存在偏差或过度拟合问题,其对于提升代码质量与修复缺陷的真实价值有待厘清。作者通过系统性实验重新评估了这类测试的有效性,并提出了更稳健的评估框架,以指导未来LLM在软件工程中的可靠应用。这一工作对于推动AI辅助编程工具的健康发展具有重要意义。 #LLM #软件工程 #测试生成 #AI #研究 #arXiv #代码质量
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
英伟达发布首款PC超级芯片,黄仁勋称Agentic AI时代全面到来

在COMPUTEX 2026主题演讲中,英伟达CEO黄仁勋宣布智能体AI(Agentic AI)时代全面到来,指出token成为利润单位,算力即收入与利润。同时,英伟达正式进军PC市场,发布基于Arm架构的RTX Spark超级芯片(含此前代号N1X),专为Windows笔记本和小型工作站设计,自称“有史以来最高效的平台”。黄仁勋还透露,专为AI智能体打造的Vera CPU已全面投产,速度比x86处理器快1.8倍,可驱动多样化工作负载。他强调,传统应用代码在操作系统内运行的模式已被打破,新模式以大语言模型为核心,通过安全套件编排,处理包含工作记忆、长期记忆及工具使用的复杂工作流。 #英伟达 #PC超级芯片 #RTXSpark #AgenticAI #黄仁勋 #COMPUTEX #VeraCPU #芯片 #AI
奥尔特曼预言AI第三阶段,SpaceX冲刺1.78万亿美元估值,Anthropic发布安全架构

OpenAI CEO山姆·奥尔特曼近日提出AI发展将进入第三阶段,强调通用人工智能(AGI)的临近,并呼吁行业关注安全与治理。与此同时,SpaceX正寻求高达1.78万亿美元的IPO估值,成为全球最具价值的私营公司之一,其星链和星舰项目被视为估值核心。此外,Anthropic发布了Claude的安全隔离架构,通过分层权限和实时监控机制,旨在提升AI系统的可控性和抗风险能力。这些动态标志着AI和航天领域正加速变革,技术商业化与安全治理并行推进。 #AI #OpenAI #SpaceX #Anthropic #通用人工智能 #IPO #安全架构 #科技新闻
英伟达推出RTX Spark处理器,定义AI PC新标准

在GTC 2025大会上,英伟达发布全新RTX Spark处理器,标志着Windows PC正式进入AI智能体时代。RTX Spark搭载Blackwell GPU、与联发科合作定制的20核Grace CPU及128GB统一内存,FP4算力达1 petaflop,支持14毫米厚、3磅重的笔记本形态。黄仁勋强调,PC将从手动操作工具转变为运行智能体的AI超级计算机,可本地运行模型并调用软件工具完成复杂任务。同时,英伟达展示下一代AI超级芯片平台Vera Rubin,面向Agentic AI设计,并推出自研Vera CPU以优化智能体调度与延迟。RTX Spark提供笔记本、台式机、工作站三种形态,兼容Windows、CUDA及AI软件栈,目标让PC原生运行智能体,成为个人AI平台。 #英伟达 #AI #PC #智能体 #RTXSpark #VeraRubin #GTC #科技 #Windows #Agent
Meta AI客服被简单黑客攻破,暴露AI安全短板

近日,Meta的AI客服系统曝出严重安全漏洞:黑客只需使用与账户所有者匹配的VPN地址,直接向AI客服请求更改邮箱地址,系统便轻易执行。这一攻击手法极其简单,却成功绕过了安全防线。杜克大学教授Neil Gong指出,这种基础漏洞本应在部署前就被发现,Meta的疏忽令人惊讶。乔治城大学研究员Jessica Ji质疑Meta是否设置了基本的安全护栏。专家分析,AI代理的灵活性使其容易受骗,它们像急于完成任务的小学生,缺乏人类客服的警惕性。尽管可通过传统软件设置规则和红队测试来降低风险,但大语言模型的概率性本质意味着AI代理始终存在被攻击的可能。Meta已表示该漏洞已修复,但此事件凸显了AI安全面临的普遍挑战。 #AI安全 #Meta #黑客 #人工智能 #网络安全 #漏洞 #AI代理 #大模型 #科技新闻
交叉验证模型比较的相对不稳定性研究

一项最新研究揭示了使用交叉验证进行模型比较时存在显著的不稳定性。论文作者Alexandre Bayle等人通过理论分析和实验验证,指出交叉验证选择的模型在不同数据分割下可能产生截然不同的排名,导致模型选择结果不可靠。研究建议在实际应用中应谨慎依赖单一交叉验证结果,并考虑多重验证或更稳定的评估方法。该发现对机器学习模型评估与选型具有重要警示意义。 #机器学习 #交叉验证 #模型比较 #稳定性 #AI #arXiv #学术研究
《Control Resonant》既是续作,也是新起点

芬兰游戏开发商Remedy Entertainment正式公布了《Control Resonant》。从时间线来看,它是2019年《Control》的续作,但在叙事和玩法上两者并不直接延续。Remedy表示,这两款游戏更像是同一枚硬币的两面——共享世界观却各自独立。新作将引入全新的主角和超自然能力系统,同时保留前作标志性的物理破坏与悬疑氛围。玩家不需要通关前作即可直接体验,这降低了新用户的门槛。目前官方尚未公布具体发售日期,但已确认将登陆PC与主机平台。 #游戏 #Remedy #Control #ControlResonant #续作 #超自然 #动作冒险 #游戏新闻
华为云发布“Agentic Infra”新范式,极致重构AI算力底座

在华为云最新技术解读中,其正式提出“Agentic Infra”新范式,核心是构建面向Agent时代的云基础设施——“Agentic计算机”。随着云计算进入Token工业时代,华为云通过软硬芯深度协同,实现四大突破:灵衢网络将分散资源互联成一体;基于昇腾950打造1024卡灵衢智能计算集群,算力提升2.6倍;推出记忆存储解决方案AMS,为Agent提供PB级超大记忆空间,缓存命中率提升至95%、成本节省63%;以及高性能极简网络支持灵活配比。同时,FlexNPU柔性液态算力架构实现算子级时空复用,将节点弹性及故障恢复时间从分钟级降至秒级。华为云表示,该技术将赋能中国企业Agent创新,提供坚实高效的国产底座。 #华为云 #AgenticInfra #AI基础设施 #大模型 #云计算 #昇腾 #智算集群