欢迎访问安徽招聘网!本站为找工作者提供合肥人才市场招聘信息、安徽人才网发布最新宿州、淮北、阜阳、合肥、蚌埠、淮南、滁州、六安、马鞍山、铜陵、黄山等岗位招聘信息!

网站地图
安徽招聘网

安徽站[切换城市]
  • 职位
    • 公司
    • 职位
  • 安徽招聘网 www.ahrczp.net 提示:

    确认
    安徽招聘网 安徽招聘网 > 招聘列表 > 招聘详情 >

    优图实验室-图文(含OCR)多模态视觉细粒度理解研究

    优图实验室-图文(含OCR)多模态视觉细粒度理解研究

    职位月薪:面议

    优图实验室-图文(含OCR)多模态视觉细粒度理解研究

    职位月薪: 面议

    • 岗位类别:
    • 招聘类型: 校园
    • 工作经验: 应届生
    • 工作地点:
    • 学历要求: 硕士研究生
    • 招聘人数: 1人
      福利待遇:
    • 五险一金
    • 优质平台
    • 法定节假日休息
    • 年终奖

    收藏 收藏 小程序 小程序 岗位分享 微信分享

    聊一聊 和TA聊一聊  投递简历 投个简历

    联系方式

    联系人:深圳市腾讯计算机系统有限公司

    联系电话:152****5633

    点击查看
    打电话联系前先投递一份简历,面试成功率提高60%!

    (联系我时,请说是在安徽易职邦上看到的)

    职位描述

    课题背景:随着多模态大模型能力的持续跃升,视觉理解的边界正从粗粒度的图像描述向细粒度的精准感知与深度语义理解加速拓展。真实业务场景——如文档智能处理、工业质检、遥感解析、医疗影像分析——对模型的细粒度视觉能力提出了严苛要求:精确识别与定位图像中的文字、符号、微小目标、密集物体及复杂版式结构。然而,现有多模态模型在视觉细粒度感知方面仍存在显著短板,难以在高分辨率、复杂场景下稳定输出精准的结构化理解结果。本课题旨在系统性突破多模态模型的细粒度视觉理解能力,覆盖文字识别、文档解析、视觉定位与精细属性理解等核心子任务。课题挑战:1. 细粒度视觉感知与高分辨率建模:针对密集文字、微小目标和高分辨率输入时存在语义损失,如何设计兼顾全局上下文与局部精细特征的视觉感知能力,使模型在保持高效推理的同时实现像素级精度的视觉理解;2. 复杂场景 OCR 与文档结构化解析:真实文档涵盖多栏排版、嵌套表格、图文混排、手写印刷混合等复杂版式,如何实现文字识别与文档逻辑结构的联合建模,输出保留层次语义的结构化内容,支撑下游 RAG、信息抽取等高价值应用;3. 视觉定位与细粒度属性理解:Referring、Grounding、计数、关系推理等细粒度任务要求模型在视觉空间与语义空间之间建立精准映射,如何设计统一的细粒度理解框架,在单一模型内协同解决定位、识别与属性描述等多类子任务;4. 细粒度理解的数据构建与自动化评估:细粒度任务对标注质量要求极高且人工成本巨大,如何设计高效的自动化数据合成流水线与可扩展的评估体系,覆盖多样场景与任务类型,驱动模型能力的持续迭代。具体工作:你将参与细粒度视觉 Encoder 架构设计、复杂场景 OCR 与文档解析算法研究、多任务细粒度理解框架构建、训练数据自动合成与评估系统建设,推动原生多模态大模型在视觉细粒度理解方向的能力突破。1、计算机科学、人工智能、模式识别、计算机视觉、自然语言处理等相关专业的博士及优秀硕士;具有目标检测、OCR、文档理解、视觉定位或细粒度识别方向研究背景者优先;2、深入理解多模态细粒度理解前沿进展,熟悉 ViT、CLIP、Grounding DINO、SAM、InternVL、Donut 等技术路径;精通 PyTorch,熟悉分布式训练框架(DeepSpeed、Megatron-LM);在 CVPR、ICLR、NeurIPS、ECCV、ICDAR 等顶会有相关成果者优先;熟悉 Python 编程,有 CUDA 优化经验者更佳;3、对细粒度视觉理解技术有强烈研究热情,具备将复杂视觉问题抽象为可量化技术命题的能力;沟通协作能力强,能在多方向交叉的大型项目中高效推进;具备面对开放性难题的韧性与独立攻坚精神。

    二维码微信扫一扫,及时了解投递状态
    头像您目前还没有登录:立即登录

    课题背景:随着多模态大模型能力的持续跃升,视觉理解的边界正从粗粒度的图像描述向细粒度的精准感知与深度语义理解加速拓展。真实业务场景——如文档智能处理、工业质检、遥感解析、医疗影像分析——对模型的细粒度视觉能力提出了严苛要求:精确识别与定位图像中的文字、符号、微小目标、密集物体及复杂版式结构。然而,现有多模态模型在视觉细粒度感知方面仍存在显著短板,难以在高分辨率、复杂场景下稳定输出精准的结构化理解结果。本课题旨在系统性突破多模态模型的细粒度视觉理解能力,覆盖文字识别、文档解析、视觉定位与精细属性理解等核心子任务。课题挑战:1. 细粒度视觉感知与高分辨率建模:针对密集文字、微小目标和高分辨率输入时存在语义损失,如何设计兼顾全局上下文与局部精细特征的视觉感知能力,使模型在保持高效推理的同时实现像素级精度的视觉理解;2. 复杂场景 OCR 与文档结构化解析:真实文档涵盖多栏排版、嵌套表格、图文混排、手写印刷混合等复杂版式,如何实现文字识别与文档逻辑结构的联合建模,输出保留层次语义的结构化内容,支撑下游 RAG、信息抽取等高价值应用;3. 视觉定位与细粒度属性理解:Referring、Grounding、计数、关系推理等细粒度任务要求模型在视觉空间与语义空间之间建立精准映射,如何设计统一的细粒度理解框架,在单一模型内协同解决定位、识别与属性描述等多类子任务;4. 细粒度理解的数据构建与自动化评估:细粒度任务对标注质量要求极高且人工成本巨大,如何设计高效的自动化数据合成流水线与可扩展的评估体系,覆盖多样场景与任务类型,驱动模型能力的持续迭代。具体工作:你将参与细粒度视觉 Encoder 架构设计、复杂场景 OCR 与文档解析算法研究、多任务细粒度理解框架构建、训练数据自动合成与评估系统建设,推动原生多模态大模型在视觉细粒度理解方向的能力突破。1、计算机科学、人工智能、模式识别、计算机视觉、自然语言处理等相关专业的博士及优秀硕士;具有目标检测、OCR、文档理解、视觉定位或细粒度识别方向研究背景者优先;2、深入理解多模态细粒度理解前沿进展,熟悉 ViT、CLIP、Grounding DINO、SAM、InternVL、Donut 等技术路径;精通 PyTorch,熟悉分布式训练框架(DeepSpeed、Megatron-LM);在 CVPR、ICLR、NeurIPS、ECCV、ICDAR 等顶会有相关成果者优先;熟悉 Python 编程,有 CUDA 优化经验者更佳;3、对细粒度视觉理解技术有强烈研究热情,具备将复杂视觉问题抽象为可量化技术命题的能力;沟通协作能力强,能在多方向交叉的大型项目中高效推进;具备面对开放性难题的韧性与独立攻坚精神。

    二维码微信扫一扫,及时了解投递状态
    头像您已有可投递的在线简历:点击投递
    简历完成度50%,完善简历才能找到好工作:完善简历

    公司介绍

    企业尚未更新

    工作地点

    地址安徽省

    查看地图

    看了此职位的人还会看
    查看更多相似的职位 >>

    公司信息 公司信息

    公司信息 给我留言

    推荐职位 相关公司推荐

    • 头像

      安徽环乐教育科技有限公司

      热招4个职位
      查看
    • 头像

      合肥欣诺房地产经纪有限公司

      热招5个职位
      查看
    • 头像

      大荔宏丰瓜果农民专业合作社

      热招1个职位
      查看
    • 头像

      安徽珈煜文化传媒有限公司

      热招1个职位
      查看
    • 头像

      安徽旭卓教育科技有限公司

      热招2个职位
      查看
    二维码

    扫描二维码及时订阅职位

    最新职位信息第一时间知晓

    安徽兼职招聘

    • 扫码下载APP

      安徽招聘网APP
    • 扫码进小程序

      安徽招聘网小程序

    服务信息

    联系电话: 17755100523

    服务时间:08:00-18:00

    安徽招聘网 | 合肥人才市场 | 合肥找工作 | 安徽人才网 | 合肥招聘网

    Copyright 2012-2022 安徽招聘网 All Rights Reserved

    详细地址:江西省南昌市青山湖区高新大道万象汇9号楼7楼

    版权所有:江西易职邦网络科技有限公司

    ICP证:赣ICP备2021008707号 赣公网安备 36010202000583号

    技术支持:江西易职邦人力资源有限公司

    关注公众号

    服务时间08:00-24:00

    微信公众号

    微信公众号

    招聘交流群

    招聘交流群

    微信小程序

    微信小程序

    微信扫一扫

    面试通知

    收藏

    简历

    足迹

    微信求职

    关注公众号

    掌握最新求职动态

    微信公众号

    小程序

    进入小程序

    随时随地找工作

    小程序