助力降低AI引文幻觉提升准确率 新款开源语言模型与人类专家相仿
中新网北京2月5日电 (记者 孙自法)国际知名学术期刊《自然》最新发表一篇计算机科学论文称,研究人员开发出一个开源语言模型OpenScholar,其在进行准确文献综述方面可超越商用大语言模型(LLM)。在本项研究开展的实验中,GPT4o会在78%-90%的情况下出现引文幻觉,而OpenScholar的引文准确率却与人类专家相仿。
论文作者指出,虽然OpenScholar后续仍需进一步优化,但该AI工具有望帮助科学家处理复杂且日益繁重的科学文献综述任务。
本项研究相关示意图(图片来自论文)。施普林格・自然 供图据介绍,科学文献综述对于支持循证决策、微调科学过程和引导新发现都很重要。然而,文献发表数量的增长使研究人员很难掌握全部资讯。大语言模型可以提供协助,但却很容易出错,如归因能力有限和引文幻觉。
为了生成准确、全面、透明的科学文献综述,美国华盛顿大学Akari Asai、Hannaneh Hajishirzi和同事及合作者一起,研发推出了开源语言模型OpenScholar。该模型是专为科研任务设计的检索增强语言模型,其他系统也用过这个框架,但论文作者将其与一个包含4500万篇最新开放获取科研论文的专业数据库以及一个自我评估机制相结合,从而优化其输出。
论文作者还创建了名为ScholarQABench的基准工具来评估文献综述的自动化。研究显示,OpenScholar的准确率比GPT4o和PaperQA2(一个文献综述工具)这类现有系统分别高出6.1%和5.5%。此外,OpenScholar生成的答案在50%到70%的情况下比专家注释器的答案更有用。
这些研究结果和引文幻觉大幅下降,证明了OpenScholar有望支持和推动进一步研究工作。论文作者也提醒说,该AI系统仍有局限性,同时,基于语言模型的系统无法使科学文献综述完全自动化。因此,他们向学界同时开放ScholarQABench和OpenScholar,以鼓励进一步研究和优化。(完)
3月18日是第24个“全国爱肝日”。今年活动的主题是,“早防早筛,远离肝硬化”。重庆多所医院开展义诊咨询活动,通过普及肝病的防治知识,让民众主动筛查、规范治疗、定期随访,提高大众爱肝护肝意识, 3月20日对于我国抗衰老研究是个特殊的日子,经过近3年的不懈努力,八子补肾胶囊抗衰老取得又一重大突破。挑战人类生命极限是摆在全球科学家面前的重大课题,抗衰老研究已成为世界生命科学领域关注 记者19日从兰州大学获悉,天华肉羊通过国家畜禽遗传资源委员会审定鉴定,成为我国首个适应高寒气候的肉羊品种。该品种由兰州大学草地农业科技学院李发弟教授和乐祥鹏教授团队,联合甘肃省武威市天 据英国《金融时报》网站3月13日报道,科学家们已经在利用人工智能(AI)阐释人体所谓的“黑暗基因组”,并开发一种可能很强大的癌症检测、监测和治疗新方法。美国约翰斯·霍普金斯大学的研 3月24日消息,今日一则#男孩捡17岁女生电话归还反被讹200#的话题登上微博热搜,引发网民热议。据报道,3月23日,山西长治。郭女士父亲捡到一台iPhone电话,归还时机主反称电话后壳里的200元现金不见了。郭 随着无人驾驶技术的快速发展,无人车在城市配送、环卫清扫、安防巡逻等应用场景中已得到较好示范应用。3月22日,南京溧水经济开发区管委会与南京易咖智车科技有限公司联合举办“金陵智地 易启未 。本文链接:助力降低AI引文幻觉提升准确率 新款开源语言模型与人类专家相仿http://www.sushuapos.com/show-2-15235-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。