AI知识库 @ai521
328 subscribers
22.3K photos
42 videos
19 files
854 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
FormulaSPIN:自我博弈微调实现自然语言转电子表格公式

研究人员提出一种名为FormulaSPIN的新方法,利用自我博弈微调技术,将自然语言描述自动转换为电子表格公式。该方法通过让模型在生成公式后自我评估并优化,显著提升了公式生成的准确性和鲁棒性。实验表明,FormulaSPIN在多个基准测试中优于传统监督微调方法,尤其在处理复杂嵌套公式和条件逻辑时表现突出。这项研究为办公自动化领域提供了新的技术路径,有望降低用户使用电子表格的门槛。 #自然语言处理 #电子表格 #自我博弈 #AI #办公自动化 #公式生成 #机器学习
大型语言模型中的信息辨别能力研究

一篇题为《大型语言模型中的信息辨别能力》的学术论文在arXiv平台发布。该研究由Joshua Ashkinaze等七位作者共同完成,探讨了大型语言模型在处理信息时的辨别能力。论文详细分析了模型如何区分真实与虚假信息,以及在不同语境下的表现。研究团队通过实验评估了模型在信息筛选、事实核查等方面的能力,并提出了改进模型信息辨别性能的方法。该论文的发布为理解大型语言模型的认知能力提供了新的视角,对提升AI系统的可靠性和准确性具有重要意义。 #AI #大型语言模型 #信息辨别 #学术研究 #arXiv
NEXUS: 为工具型LLM代理提供结构化运行时安全

一篇题为《NEXUS: Structured Runtime Safety for Tool-Using LLM Agents》的学术论文近日在arXiv预印本平台发布。该研究由Elias Hossain等五位作者共同完成,聚焦于大型语言模型(LLM)代理在使用外部工具时的运行时安全问题。论文提出了一种名为NEXUS的结构化安全框架,旨在通过系统化的运行时监控与约束机制,防止LLM代理在执行工具调用时产生有害或不可预测的行为。研究团队认为,随着LLM代理在代码执行、数据库查询等场景中广泛应用,确保其在运行时遵循安全边界至关重要。NEXUS框架通过定义明确的权限与行为规则,为代理的自主操作提供了可验证的安全保障。该工作为提升AI代理在实际部署中的可靠性提供了新的思路。 #NEXUS #LLM #AI安全 #工具代理 #学术论文 #arXiv #人工智能
多目标生成式推荐系统的随机原始

研究人员提出了一种名为随机原始-对偶解码的新方法,用于多目标生成式推荐系统。该方法通过将推荐问题建模为多目标优化,在解码阶段同时考虑多个目标(如准确性、多样性和新颖性),并采用随机原始-对偶算法在生成过程中动态平衡这些目标。实验表明,该方法在多个基准数据集上显著优于传统单目标推荐和简单多目标融合方法,能够生成更符合用户多样化需求的推荐结果。该工作为生成式推荐系统的多目标优化提供了新的理论框架和实用算法。 #推荐系统 #多目标优化 #生成式模型 #随机算法 #机器学习
LISA:线性索引稀疏注意力机制实现高效长文本推理

arXiv 上发布了一篇题为《LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning》的研究论文。该论文由 Yu Zhao 等作者提出了一种名为 LISA 的新型注意力机制,旨在解决大语言模型在处理超长上下文时计算成本过高的问题。LISA 通过引入线性索引和稀疏注意力模式,显著降低了长文本推理过程中的计算复杂度,同时保持了模型对关键信息的捕捉能力。这一方法有望提升 AI 模型在文档分析、代码理解等需要处理大量上下文场景中的效率与性能。 #AI #大模型 #注意力机制 #长文本推理 #arXiv #论文 #机器学习
Profile-Graph Memory

一篇来自arXiv的论文提出了一种名为Profile-Graph Memory的新型记忆架构,旨在提升大语言模型智能体在复杂叙事场景中的跨实体信息遍历能力。该方法通过构建基于叙事轮廓的隐式图谱,使智能体能够更高效地关联不同实体间的信息,从而在长文本推理和角色关系理解等任务中表现更优。研究团队表示,该架构有望增强LLM在对话系统、游戏NPC和自动化叙事生成等领域的应用效果。 #LLM #AI #记忆架构 #叙事图谱 #智能体 #arXiv #科技论文
数据科学背后的悲伤故事

近日,一则关于乘客因航班超售被拒载的帖子在社交媒体上引发热议。如果你常坐飞机,或许也遇到过类似情况。这看似是操作失误,实则不然。在航空业,这类“错误”往往是航空公司为最大化利润而有意为之的风险决策。从数据科学角度看,这是一个基于概率和数学的统计权衡。以一家虚构的“数据科学航空公司”为例,他们为容量300人的航班售出304张机票。根据历史数据,乘客实际登机的概率为95%。假设每位乘客独立登机(忽略家庭或团体同行的复杂情况),那么实际登机人数服从二项分布。通过计算,当超过300人登机时,航班就会超售。这一模型揭示了航空公司如何在概率计算与利润最大化之间做出抉择。 #数据科学 #航空超售 #概率论 #二项分布 #商业决策 #数学建模
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
RAG 幻觉多是提取错误

并非所有问题都期待相同形式的答案。有的需要带引用的单一数字,有的需要每行一个条目的列表,还有的需要带条件的“是”或“否”。若强行通过一次生成调用处理所有形状,每种形状都会相互干扰。解决方案是采用一小套生成模式,每种答案形状对应一种模式。本文是《企业文档智能》系列的配套内容,该系列哲学在《放大专家》中阐述,聚焦于四砖架构中的第四块(生成),并反驳团队在RAG答案错误时常用的词汇。严格意义上的“幻觉”是模型参数记忆中的捏造:大语言模型凭空编造事实,毫无输入依据。在RAG中,模型读取上下文;答案错误时,原因在上游的提取链(解析、问题、检索或生成契约本身)。将每次失败都称为“幻觉”会关闭行动方向的讨论,而命名真正原因则重新开启讨论。主流叙事将生成视为“发送检索块+问题给LLM,返回答案字符串”,我们拒绝这一框架。答案不是字符串,而是带引用、保真度标志和自我评估字段的类型化Pydantic对象。LLM是函数,而非神谕。模式即契约,验证器在用户看到任何内容前运行。七种模式包括:答案模式是契约,结构化检索输入,类型化Pydantic对象输出,带引用、保真度标志和管道反馈字段,绝不仅是“答案字符串”。例如,“保费金额是多少?”基线返回句子:“保费为每月124美元,按合同。”下游需从散文中解析数字,且无来源或置信度信息。系列返回行:Amount(value=124.0, currency="USD", unit="month", evidence=[Span(line_start=42, line_end=42, quote="premium of $124 / month")], answer_found=True, confidence=0.95)。值已类型化,证据指向精确行,自我评估字段伴随。调用者读取结构化值,而非需重读的文本。 #RAG #大模型 #幻觉 #生成契约 #Pydantic #AI #企业文档智能 #技术架构
八年机器学习经验总结

一位机器学习从业者回顾其8.5年的ML生涯,总结出推动进步的五项核心要素:耐心、纪律、乐观、优质项目与优秀团队。作者指出,机器学习领域极其广阔,无人能通晓全部,但通用经验可跨领域适用。他以自身论文经历为例,强调耐心的重要性——一篇论文曾被拒四次,历经两年反复修改才最终被顶级会议接收。同时,作者认为培养健康的乐观心态至关重要,面对项目中的障碍,既要坚持,也要对自身工作保持沉默的信任。此外,纪律、选择好项目以及组建优秀团队同样不可或缺。这些经验不仅适用于机器学习,也适用于任何领域的进步。 #机器学习 #经验总结 #AI #科研 #耐心 #乐观 #团队协作
为什么增加AI Agent反而让系统变慢了

在构建基于大语言模型的产品时,团队最初部署少量Agent时一切正常,但随着Agent数量增加,系统延迟逐渐升高,甚至出现超时错误。经过排查,发现问题并非出在LLM提供商(如OpenAI或Anthropic)身上,而是代码架构本身存在瓶颈。Planck团队在生产环境中运行多个LLM Agent,所有Agent由单一服务管理,一个请求会同时触发所有Agent,每个Agent再调用数十个子Agent。虽然代码使用了Python的异步机制,理论上所有I/O操作应并发执行,延迟应取决于最慢的LLM调用而非Agent总数,但实际测试显示,随着Agent和子Agent数量增加,系统延迟呈指数级增长。团队通过本地FastAPI服务器模拟LLM响应时间,发现即使使用异步编程,大量并发请求仍会导致资源竞争和上下文切换开销,最终拖慢整体响应速度。 #AI #LLM #Agent #系统设计 #性能优化 #异步编程 #技术架构