DeepSeek представил технологию сжатия текста для ИИ

deepseek

Китайский ИИ-стартап DeepSeek представил новый мультимодальный ИИ, способный обрабатывать большие и сложные документы с задействованием значительно меньшего количества токенов.

DeepSeek-OCR применяет визуальное восприятие как средство сжатия информации.

Система стала результатом исследования «роли визуальных энкодеров» для сжатия текста в больших языковых моделях (LLM). Благодаря такому подходу нейросети способны обрабатывать огромные объемы информации без пропорционального роста затрат на вычисления.

«С помощью DeepSeek-OCR мы продемонстрировали, что сжатие текста через визуальные представления позволяет сократить количество токенов в 7–20 раз на разных стадиях контекста. Это открывает перспективное направление для решения проблемы длинной истории в LLM», — заявили в компании.

DeepSeek-OCR состоит из двух основных компонентов:

  • DeepEncoder — кодировщик;
  • DeepSeek3B-MoE-A570M — декодер.

Первый служит основным вычислительным ядром модели. Он сохраняет низкую активность в ходе обработки изображений высокого разрешения, одновременно достигая существенного уровня сжатия. Это позволяет сократить количество токенов.

Декодер — модель Mixture-of-Experts с 570 млн параметров — отвечает за восстановление исходного текста. Архитектура делит нейросеть на несколько независимых подсетей — «экспертов», каждый из которых специализируется на своей части входных данных. Вместе они решают общую задачу.

DeepSeek-OCR способна анализировать сложно структурированный визуальный контент, таблицы, формулы и геометрические схемы. По словам компании, это делает модель особенно полезной для применения в финансовой сфере и научных исследованиях.

Она отметила, что DeepSeek-OCR достигала 97% точности декодирования. При коэффициенте 20х модель сохраняла около 60%. Это подчеркивает ее способность не терять информацию даже при экстремальном уровне сжатия.

На OmniDocBench — эталонном тесте для оценки понимания разнообразных документов — DeepSeek-OCR превзошла ведущие модели оптического распознавания текста вроде GOT-OCR 2.0 и MinerU 2.0. При этом она использовала значительно меньше токенов.

Напомним, в августе стартап обновил свою флагманскую ИИ-модель V3.

Подписывайтесь на новости AIcybernews.com в Twitter и Facebook

Другие новости

0 0 голоса
Рейтинг статьи
Подписаться
Уведомить о
guest
0 комментариев
Старые
Новые Популярные
Межтекстовые Отзывы
Посмотреть все комментарии

Актуально

Последние новости

Lenovo представляє надлегкий 16-дюймовий ноутбук Lecoo Air 16

Компанія Lenovo випускає тонкий легкий ноутбук Lecoo Air 16, який претендує на звання одного з найлегших у форматі 16 дюймів. Раніше на виставці IFA...

Anthropic запустила ИИ-кодер Claude Code для браузера

Компания Anthropic запустила веб-приложение для своего популярного помощника по программированию Claude Code. Теперь он позволяет разработчикам создавать и управлять несколькими ИИ-агентами напрямую из...

В РФ предлагают делить криптовалюту поровну между супругами

Депутат Госдумы от партии «Единая Россия», член комитета промышленности и торговли Игорь Антропенко предложил законопроект, согласно которому криптовалюта, приобретенная в браке, будет считаться...