合合信息借AI突破技术创新 提升智能文档处理能力
日常工作中的合同、发票、档案等文件存在被拍照、扫描成电子文档的过程中,出现漏字、错位现象,背后正是因为“版面分析”技术的识别效果原因。
合合信息通过技术创新和智能识别技术的突破优化攻破版面分割、区域间的逻辑关系处理等方面的难题,通过智能文字识别、智能图像处理等核心技术,助力使用者从各类复杂的图片文档中精准获取信息。
据了解,版面分析的目的是让机器“看懂”文档结构,即将文档图像分割成不同类型内容的区域,并分析区域之间的关系,这是内容识别之前的关键步骤。
据中国科学院自动化研究所多模态人工智能系统全国重点实验室联合多所高校发布的论文显示,版面分析主要包括物理版面分析(区域分割、分类,文本检测与定位,文本行分割等),手写及印刷区分,表格分析(单元格提取与关系分析),逻辑版面分析(区域语义分类、阅读顺序),以及签名、图标、印章等版面元素的提取等。其中物理版面分析主要解决区域分割问题,逻辑版面分析则关注区域之间的逻辑关系或阅读顺序。
合信息表格结构解析方法在逻辑版面分析中发挥了重要作用,主要包括自上而下的方法、自下而上的方法以及端到端图像到标记的方法等。在财报相关表格识别测试中,有线表识别单元格结构准确率高于98%;无线表识别中,在保证表格区域内容的完整性的同时,检测准确率较传统方法显著提升。
传统的版面分析方法在进行版面布局分析和表格处理时会明显受制于版式差异,在应对不同场景下的文档图片时泛化效果存在缺陷,而深度神经网络的引入有效解决了这些问题。
合合信息技术相关负责人表示,得益于全卷积神经网络(FCN)和图神经网络(GNN) 的突破,文档版面分析的方法和性能得到了很大发展。公司基于深度学习的方法,结合文本区域的几何坐标、视觉特征、文本语义等多种模态信息对文本阅读顺序进行预测,显著提升分类结果。
上一篇:102.3秒领略102.3米的亚洲第一高树!快来看“多样星球”摄制组青藏科考随队
下一篇:弘揚絲路精神 深化亞歐合作
最近更新家庭教育
- 新发现:成都不孕不育医院排名“排名名单”成都孕前检查去哪个医院
- 高质量发展的时代要求和历史任务
- 听川财老校长讲校史诉校情:狠抓教学质量助推学校发展
- 深耕诉源治理,共奏新时代调解工作新乐章
- 网友反映有中学面试掐尖招生,吕梁回应
- 系列红色教育 塑亮培训底色
- 2020年4月山东省高等教育自学考试报考简章
- “四课”协同 全面推进中小学反邪教教育
- 《以创意之名遇见可持续未来》展览在雷士德工学院旧址展出
- 赞!建德三所学校上榜
- 公开排名!贵阳市心理咨询机构”排名前十”
- 托福独立写作评分
- 北京国际摄影周 | 影像·北京论坛活动招募
- 量子之歌旗下讲真学堂打造短视频训练营 助力大众用专业知识抓住市场机遇
- 产教融合共发展(人民眼·推动现代职业教育高质量发展)
- 浦东大力推进“宝宝屋”建设,给予幼儿最温柔的呵护
- 加拿大艺术类留学费用大概多少
- 注册会计师月薪一般是多少?揭秘来了!
- 四川巩固拓展脱贫攻坚成果同乡村振兴有效衔接工作成色足
- 贵州毕节一在建铁路隧道发生爆炸致5死1伤
- 重走西北角 | 兰州新区:“引才机制”打造人才集聚新高地
- 游泳世界杯雅典站|张雨霏夺得含金量极高一冠 覃海洋连夺蛙泳15金无敌
- 济南历下区燕山小学六(10)中队参加法治宣讲志愿服务活动
- 报名自考专科后怎么进行学习?
- 各乡镇以不同形式开展文明实践活动