SIGN IN SIGN UP

🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.

0 0 226 Python

Add Deepseek-OCR-2 model (#45075)

* feat: add DeepSeek-OCR-2 model registration and docs

* feat: add DeepseekOcr2ImageProcessor

* feat: add DeepseekOcr2Processor and refactor image processor tile_size

* feat: add script to convert DeepSeek-OCR-2 weights to Hugging Face format

* feat: enhance DeepSeek-OCR-2 processing  and inference test

* refactor

* feat: add fast image processor

* refactor

* test: add image processor tests for DeepseekOcr2

* fix: make background_color configurable

* refactor: migrate image processors to pil/torchvision backend pattern

* test: add processor tests for DeepseekOcr2

* fix: update __init__

* chore: clean up unused imports and fix formatting

* feat: add configuration, modeling, and modular for DeepseekOcr2

* fix: style fixes, update docs, and minor cleanups

* fix: use @strict

* fix: register private models

* docs: add usage example and expand DeepSeek-OCR-2 model doc

* fix: add checkpoint to auto_docstring

* fix: remove comment

* fix: remove unused max_query

* fix: clean up DeepSeek-OCR2 modular

* docs: update date

* refactor: inherit SamVisionEncoder

* refactor: use create_causal_mask with or_mask_function

* docs: update date

* fix: address PR review

* refactor: use modular for image processor

* refactor: restructure DeepSeek-OCR-2 config, image processor, and processing

* fix: sync hidden_size and rms_norm_eps from encoder_config to vision_config

* refactor: remove comment

* fix

* fix: correct EncoderConfig docstring example

* refactor: add PIL image processor to modular

* refactor: address review comments on config, processor, and model

* fix: adjust processing tests for image token expansion

* fix: move view_separator to correct device for model parallelism

* fix: add DeepseekOcr2ImageProcessorPil to __all__

* fix: remove SDPA skip

* test: skip offload/export tests

* refactor: address review comments

* fix: remove  in DeepseekOcr2Model

* refactor: enforce explicit  tokens in DeepseekOcr2Processor

* refactor: inherit DeepseekOcr2ImageProcessorKwargs from GotOcr2ImageProcessorKwargs

* refactor: remove unused image processing

* fix: update docs

* fix: export sub-configs

* Update src/transformers/models/deepseek_ocr2/modular_deepseek_ocr2.py

Co-authored-by: Anton Vlasjuk <73884904+vasqu@users.noreply.github.com>

* refactor: switch to mlp_layer_types pattern and clean up redundant overrides

* refactor: derive projector dims from sub-configs

* refactor: address comments on naming, decorators, and mask location

* refactor: use VLMModelTester, fix processor text handling, and cache test images

* fix: enable fullgraph compile

* refactor: move weight mapping to conversion_mapping.py

* fix: add tie_word_embeddings

* refactor: address review comments

* make ci compatible, passed without changes neat

* fixup imports

* switch vision encoder mask to block_sequence_ids

* update docs

* update docs

* Clean up DeepSeek-OCR-2 converted config

* update DeepSeek-OCR-2 checkpoint

* update docs and sync generated config

* fix

* ok

---------

Co-authored-by: Anton Vlasjuk <73884904+vasqu@users.noreply.github.com>
Co-authored-by: vasqu <antonprogamer@gmail.com>
E
Eon Kim committed
8e67c5e1d410dff56d985ba7513ccdf57ab1f894
Parent: a10a0e4
Committed by GitHub <noreply@github.com> on 6/1/2026, 9:25:44 PM