新基准CSTutorBench评估小型语言模型在块编程教学中的表现
近日,一篇题为《CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming》的论文在arXiv上发布。该研究由H. Chad Lane等人提出,旨在评估小型语言模型(SLM)在基于块的编程教学中的辅导能力。研究团队开发了CSTutorBench基准,通过标准化测试衡量SLM在理解编程概念、生成纠错提示和个性化指导等方面的表现。该工作已被SLM4ED'26(AIED 2026)研讨会接收,将于韩国首尔举行。随着AI教育应用日益普及,该基准为评估和优化教育场景下的轻量级模型提供了重要工具,有助于推动低成本、易部署的智能辅导系统发展。 #AI教育 #编程教学 #小型语言模型 #基准测试 #arXiv #SLM4ED #AIED
近日,一篇题为《CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming》的论文在arXiv上发布。该研究由H. Chad Lane等人提出,旨在评估小型语言模型(SLM)在基于块的编程教学中的辅导能力。研究团队开发了CSTutorBench基准,通过标准化测试衡量SLM在理解编程概念、生成纠错提示和个性化指导等方面的表现。该工作已被SLM4ED'26(AIED 2026)研讨会接收,将于韩国首尔举行。随着AI教育应用日益普及,该基准为评估和优化教育场景下的轻量级模型提供了重要工具,有助于推动低成本、易部署的智能辅导系统发展。 #AI教育 #编程教学 #小型语言模型 #基准测试 #arXiv #SLM4ED #AIED
Prompt-to-Paper
近日,一篇题为《Prompt-to-Paper: Agentic AI System for Bioinformatics》的论文在arXiv预印本平台上发布。该研究由Ramsha Kamran等六位作者共同完成,提出了一种基于智能体AI的生物信息学系统。该系统利用自然语言提示,能够自动完成从实验设计、数据分析到论文撰写的全流程生物信息学任务,显著降低了研究人员在复杂生物数据处理中的技术门槛。论文展示了系统在多个生物信息学基准测试中的优异表现,并讨论了其在加速科研发现方面的潜力。目前,该论文的PDF全文及HTML版本已开放获取,供学术界参考。 #AI #生物信息学 #智能体 #arXiv #学术论文 #Prompt #科研自动化 #Bioinformatics
近日,一篇题为《Prompt-to-Paper: Agentic AI System for Bioinformatics》的论文在arXiv预印本平台上发布。该研究由Ramsha Kamran等六位作者共同完成,提出了一种基于智能体AI的生物信息学系统。该系统利用自然语言提示,能够自动完成从实验设计、数据分析到论文撰写的全流程生物信息学任务,显著降低了研究人员在复杂生物数据处理中的技术门槛。论文展示了系统在多个生物信息学基准测试中的优异表现,并讨论了其在加速科研发现方面的潜力。目前,该论文的PDF全文及HTML版本已开放获取,供学术界参考。 #AI #生物信息学 #智能体 #arXiv #学术论文 #Prompt #科研自动化 #Bioinformatics
港科大发现提示词压缩成AI新攻击面,提出黑盒攻击框架COMA
香港科技大学一项最新研究揭示,大语言模型Agent中常用的提示词压缩模块可能成为新的安全漏洞。研究团队发现,攻击者无需直接注入恶意指令,只需在用户请求后添加微小扰动,就能改变压缩器的保留决策,导致关键安全规则或任务证据被删除。为此,他们提出了基于迁移的黑盒攻击框架COMA,在18个实验设置中平均攻击成功率达0.71,远超基线方法的0.21。该攻击在VSCode Cline和LangChain Agent等真实场景中均能生效,可诱导Agent读取敏感文件或选择错误工具。研究团队建议采用隔离压缩策略,将可信与不可信输入分开处理,防御成功率可达96%。该成果已被软件工程顶会ASE 2026接收。 #AI安全 #大模型 #提示词压缩 #港科大 #ASE2026 #黑盒攻击 #LLMAgent
香港科技大学一项最新研究揭示,大语言模型Agent中常用的提示词压缩模块可能成为新的安全漏洞。研究团队发现,攻击者无需直接注入恶意指令,只需在用户请求后添加微小扰动,就能改变压缩器的保留决策,导致关键安全规则或任务证据被删除。为此,他们提出了基于迁移的黑盒攻击框架COMA,在18个实验设置中平均攻击成功率达0.71,远超基线方法的0.21。该攻击在VSCode Cline和LangChain Agent等真实场景中均能生效,可诱导Agent读取敏感文件或选择错误工具。研究团队建议采用隔离压缩策略,将可信与不可信输入分开处理,防御成功率可达96%。该成果已被软件工程顶会ASE 2026接收。 #AI安全 #大模型 #提示词压缩 #港科大 #ASE2026 #黑盒攻击 #LLMAgent
AI发型预览工具HairstylesPro上线,提供500+真实发型虚拟试戴
一款名为HairstylesPro的AI工具近日在Hacker News上展示,旨在帮助用户在剪发前预览各种发型效果。用户只需上传一张清晰的正面照片,即可从500余种真实人类发型(非AI臆造)中选择,通过AI发型变换器生成逼真的试戴结果。该工具涵盖短发、中长发、长发、波波头、男士发型等多种分类,并针对不同年龄和场合提供灵感。HairstylesPro采用真实发型参考,而非随机虚拟发型,让预览结果更贴近实际剪发效果,方便用户与发型师沟通。产品提供免费试用(登录后获1次试戴),以及月度订阅和一次性信用包,适合需要多次比较发型的用户。 #AI #发型预览 #虚拟试戴 #科技 #创业 #HackerNews #工具 #创新
一款名为HairstylesPro的AI工具近日在Hacker News上展示,旨在帮助用户在剪发前预览各种发型效果。用户只需上传一张清晰的正面照片,即可从500余种真实人类发型(非AI臆造)中选择,通过AI发型变换器生成逼真的试戴结果。该工具涵盖短发、中长发、长发、波波头、男士发型等多种分类,并针对不同年龄和场合提供灵感。HairstylesPro采用真实发型参考,而非随机虚拟发型,让预览结果更贴近实际剪发效果,方便用户与发型师沟通。产品提供免费试用(登录后获1次试戴),以及月度订阅和一次性信用包,适合需要多次比较发型的用户。 #AI #发型预览 #虚拟试戴 #科技 #创业 #HackerNews #工具 #创新
0day Rubbish 发布 AI 驱动的零日漏洞自主发现平台
0day Rubbish AI Security Lab 推出了一款名为“0day Rubbish”的漏洞发现平台,该平台利用多智能体协作系统,自主发现并公开披露零日漏洞。与传统安全研究不同,该平台不囤积漏洞,而是在发现后立即发布未经授权的远程代码执行(RCE)利用,以迫使厂商快速修复。其核心理念认为“最好的零日漏洞是被修补后变成垃圾的漏洞”,强调主动披露和即时修复。平台通过隔离沙箱验证风险,并基于可复现的证明和形式化验证指标确保学术诚信。该举措旨在改变当前漏洞被武器化或私下交易的现状,推动全球网络安全生态的快速响应。 #零日漏洞 #AI安全 #漏洞披露 #网络安全 #自动化渗透 #多智能体 #开源安全
0day Rubbish AI Security Lab 推出了一款名为“0day Rubbish”的漏洞发现平台,该平台利用多智能体协作系统,自主发现并公开披露零日漏洞。与传统安全研究不同,该平台不囤积漏洞,而是在发现后立即发布未经授权的远程代码执行(RCE)利用,以迫使厂商快速修复。其核心理念认为“最好的零日漏洞是被修补后变成垃圾的漏洞”,强调主动披露和即时修复。平台通过隔离沙箱验证风险,并基于可复现的证明和形式化验证指标确保学术诚信。该举措旨在改变当前漏洞被武器化或私下交易的现状,推动全球网络安全生态的快速响应。 #零日漏洞 #AI安全 #漏洞披露 #网络安全 #自动化渗透 #多智能体 #开源安全
缅因州图书馆员帮助读者抵抗AI,提供禁用服务
缅因州西尔斯蒙特镇图书馆近期推出一项新服务:帮助读者从手机和其他设备中移除人工智能功能。图书馆馆长史蒂文·布朗表示,很多人不知道有选择权,他的工作是帮助他们禁用Siri等AI助手或邮件中的智能功能,并转向不使用AI概览的浏览器。他认为帮助人们批判性思考技术是图书馆员工作的自然延伸。邦戈公共图书馆参考馆员汉娜·赛勒斯是该运动的先驱,她开设的“避免AI”课程讲解了生成式AI的风险、如何禁用及寻找替代品。赛勒斯强调,Gmail和ChatGPT并非中立,它们是大公司获取信息和注意力的产品。她警告,AI生成的不是信息而是文字,且常混合权威与不可靠来源,损害信息评估能力,并消耗大量能源和水资源,存在隐私泄露风险。她的课程吸引了众多缅因州图书馆员参与。 #图书馆 #AI #隐私 #科技伦理 #缅因州 #信息素养 #数字权利 #反AI #BigTech
缅因州西尔斯蒙特镇图书馆近期推出一项新服务:帮助读者从手机和其他设备中移除人工智能功能。图书馆馆长史蒂文·布朗表示,很多人不知道有选择权,他的工作是帮助他们禁用Siri等AI助手或邮件中的智能功能,并转向不使用AI概览的浏览器。他认为帮助人们批判性思考技术是图书馆员工作的自然延伸。邦戈公共图书馆参考馆员汉娜·赛勒斯是该运动的先驱,她开设的“避免AI”课程讲解了生成式AI的风险、如何禁用及寻找替代品。赛勒斯强调,Gmail和ChatGPT并非中立,它们是大公司获取信息和注意力的产品。她警告,AI生成的不是信息而是文字,且常混合权威与不可靠来源,损害信息评估能力,并消耗大量能源和水资源,存在隐私泄露风险。她的课程吸引了众多缅因州图书馆员参与。 #图书馆 #AI #隐私 #科技伦理 #缅因州 #信息素养 #数字权利 #反AI #BigTech
AI算力瓶颈并非GPU短缺,内存带宽才是关键
近期,AMD与高通相继公布新型内存封装方案,英伟达则锁定SK海力士HBM供应至2030年。H100交货周期长达36-52周,数据中心预计消耗2026年70%的内存芯片。表面看是GPU短缺,实则内存带宽才是真正瓶颈——这一问题早在2007年就被诊断。Ulrich Drepper在其经典论文中指出,CPU速度远超内存,形成“内存墙”,数据位置决定代码速度。如今AI场景中,HBM相当于主存,GPU片上SRAM相当于L1缓存,大模型每次生成token需反复搬运数GB权重。FlashAttention等突破正是通过优化数据局部性,减少HBM往返,将Drepper的理念移植到Transformer上。 #AI #内存带宽 #GPU短缺 #HBM #FlashAttention #科技新闻 #算力瓶颈
近期,AMD与高通相继公布新型内存封装方案,英伟达则锁定SK海力士HBM供应至2030年。H100交货周期长达36-52周,数据中心预计消耗2026年70%的内存芯片。表面看是GPU短缺,实则内存带宽才是真正瓶颈——这一问题早在2007年就被诊断。Ulrich Drepper在其经典论文中指出,CPU速度远超内存,形成“内存墙”,数据位置决定代码速度。如今AI场景中,HBM相当于主存,GPU片上SRAM相当于L1缓存,大模型每次生成token需反复搬运数GB权重。FlashAttention等突破正是通过优化数据局部性,减少HBM往返,将Drepper的理念移植到Transformer上。 #AI #内存带宽 #GPU短缺 #HBM #FlashAttention #科技新闻 #算力瓶颈