近日,由中国图象图形学学会主办的2024中国图象图形大会在西安开幕。大会通过20多场论坛、百余项成果,集中展示了生成式人工智能、大模型、机器学习、类脑计算等多个图像图形领域的进展。
大模型一路“高歌猛进”的背后,隐藏着一场关于模型训练语料的“能源危机”。根据人工智能研究人员小组Epoch研究估计,机器学习数据集可能会在2026年前耗尽所有“高质量语言数据”。现阶段,大量的高质量语料数据存在于书籍、论文、研报、企业文档等文档之中,复杂的版面结构制约了大模型的训练语料处理及大模型文档问答的应用能力。文档解析技术的进步,让机器能够识别文档中的多种元素,更好地处理文本、表格、图像等多类型数据,还原文档阅读顺序,加速大模型训练与应用。
大会期间,由CSIG文档图像分析与识别专委会与上海合合信息科技股份有限公司(简称“合合信息”)联合主办了“大模型技术及其前沿应用”论坛。论坛上,合合信息智能创新事业部研发总监常扬表示,文档解析的难点在于如何准确识别文档中的各个元素,并理解其之间的逻辑关系,需要关注“物理版面分析”和“逻辑版面分析”。
据常扬介绍,物理版面分析侧重于视觉特征、文档布局,主要任务是把相关性高的文字聚合到一个区域,比如一个段落,一个表格等等,并选用目标检测任务进行建模,使用基于回归的单阶段检测模型进行拟合,从而获得文档中各种各样的布局方式;逻辑版面分析侧重于对语义特征的分析,主要任务是把不同的文字块根据语义建模,例如通过语义的层次关系,形成一个目录树结构。
此外,文档解析技术中文档元素检测、文字表格识别、文档版面分析、阅读顺序还原等任务涉及对版面元素和版面整体布局的判断,是文档处理领域典型的技术难题。
“我们研究过程中发现,真实世界的文档有着极为丰富的布局类型,没法单纯地用单栏,双栏、三栏等类别去定义。”常扬表示,近年来的开放词汇目标检测,视觉语义对齐等工作,以及生成式模型等前沿进展,将给版面分析带来新的研究思路。
近日,网红考研名师张雪峰在直播中称“所有文科都叫服务业”,总结起来就是“舔”,引发坊间热议;之后,他在致歉回应中称“ 一年前,美国国家点火装置(NIF)产生了一种聚变反应,其释放的能量超过消耗的能量,这种现象被称为点火。今年,NIF通过一次又一次 关于2023年第二批拟备案的省自然科学基金结题验收项目的公示 根据《河南省自然科学基金项目管理办法》(豫科〔2022 想象一下,在野外调查时,从森林或公园沿着小径行走时,需要走多远才能遇到一个新物种?从生态采样的角度来看,新种就是同一 科技日报讯 (记者张佳星)我国的临床资源十分丰富,但原创医学科研成果质量和规模与临床资源却不相匹配。如何进一步提升 省教育厅关于下达2024年普通高校“专转本”计划的通知 苏教学函〔2023〕22号 各有关高校: 根据《省教育厅关于做好2024年 。
本文链接:文档解析技术破解大模型语料“饥荒”难题http://www.sushuapos.com/show-11-6605-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。
上一篇: 范宣梅:杰青项目是我地震探索之路的基石
下一篇: 国内首套双模式推进系统实现在轨成功应用