DeepSeek добавя евтино разпознаване на изображения към V4 Flashгенерирано с ИИПотвърдено
AI модели

DeepSeek добавя евтино разпознаване на изображения към V4 Flash

Експерименталният модел на китайската лаборатория приема изображения и текст на цените на V4 Flash, но твърдението, че се доближава до Claude Opus 4.8 на Anthropic, още не е потвърдено при независими тестове.

Публикувано
NRB — News Republic Brigade

Още връзки

DeepSeek

Историята продължава

Същината

DeepSeek превърна V4 Flash в експериментален модел за изображения и текст с необичайно ниски разходи за визуален вход и щедри ограничения за групова обработка, което дава на разработчиците евтина нова възможност за работа с визуални задачи чрез изкуствен интелект (AI). Също толкова важно е какво компанията още не е публикувала: визуалната архитектура остава неизвестна, а водещото ѝ сравнение с Claude Opus 4.8 на Anthropic не е независимо възпроизведено. Собствената таблица на DeepSeek дава предимство на Opus в осем от 11 теста, а публичните резултати от Chartography засега не съвпадат с цитираните от компанията стойности.

Акценти

  • DeepSeek пусна DeepSeek-V4-Flash-Vision-Exp на 21 август с вход от текст и изображения през работещия си API.
  • Всяко изображение е ограничено до 384 входни токена, а една заявка може да съдържа до 600 изображения.
  • Vision-Exp използва цените на V4 Flash: 0,22 долара за милион некеширани входни токена извън пиковите часове и 0,44 долара в пиковите.
  • Пълното сравнение на DeepSeek в 11 теста дава три победи на Vision-Exp и осем на Claude Opus 4.8.
  • Публичната класация Chartography на Surge AI показва 15,9% за Opus 4.8 Adaptive/Max и не съдържа резултат за Vision-Exp.

Победи в сравнението на DeepSeek по 11 теста

тестове
3
8
Vision-ExpClaude Opus 4.8

щрихClaude Opus 4.8 печели осем теста, а Vision-Exp — три.

  • Графиката показва колко от 11-те публикувани от DeepSeek теста печели всеки от двата модела.
  • Vision-Exp — Експерименталният модел на DeepSeek от семейството V4 Flash, който може да обработва изображения
  • Claude Opus 4.8 — Моделът на Anthropic, използван като основен ориентир в сравнението на DeepSeek
  • Най-силното послание на DeepSeek е, че моделът се доближава до Opus, но по-широкото сравнение на самата компания все още дава предимство на Opus и са нужни независими повторни тестове.

Цени на токените за Vision-Exp

таксацена извън пиковите / в пиковите часове
Некеширан вход за милион токена$0.22 / $0.44
Изход за милион токена$0.66 / $1.32
Кеширан вход за милион токена$0.007 / $0.014
Максимална такса за некеширан вход от изображение при 384 токена$0.000084 / $0.000169
  • Таблицата показва цените на V4 Flash, които DeepSeek прилага към Vision-Exp, включително посочената максимална такса за некеширан вход от едно изображение с 384 токена.
  • Ниските цени правят мащабното тестване евтино, но разработчиците трябва сами да проверят дали силното свиване на изображенията запазва детайлите, необходими за конкретните им задачи.

Из дневника на редактора

Ниската цена може да направи един нов модел за изкуствен интелект (AI) лесен за изпробване. Твърденията за технологично лидерство обаче зависят от тестове, които други могат да повторят.

Кой участва

  • DeepSeek

    Китайска лаборатория за изкуствен интелект (AI) от Ханджоу, която разработва семейството модели V4 и продава достъп до тях чрез API

    цел → да добави разбиране на изображения към евтината си агентна система V4 Flash и да покаже резултати, близки до скъпите водещи модели

  • OpenRouter

    Външна услуга, чрез която разработчиците могат да използват модели на много доставчици през един API

    цел → да даде на клиентите си незабавен достъп до Vision-Exp и да привлече използването на новия модел

  • Surge AI

    Независимата компания за оценяване, която стои зад Chartography — тест за професионално разчитане на графики

    цел → да запази методиката и публичната си класация достатъчно прозрачни, за да могат резултатите, цитирани от създателите на модели, да бъдат възпроизвеждани

  • Datacurve

    Организацията зад DeepSWE — публичен тест на агенти за изкуствен интелект (AI), които изпълняват продължителни задачи по разработка на софтуер

    цел → да поддържа независими резултати за конкретни конфигурации, спрямо които могат да се проверяват твърденията на създателите на модели

  • Anthropic

    Американската компания за изкуствен интелект (AI), създала Claude; нейният Claude Opus 4.8 е основният модел, с който DeepSeek сравнява новата си система

    цел → да запази доверието във високия клас способности на Claude при агентни задачи и обработка на изображения; няма данни Anthropic да е отговорила пряко на премиерата на DeepSeek

Накратко

DeepSeek улеснява разработчиците да добавят евтино разпознаване на изображения към софтуер, като даде на V4 Flash възможност да приема и визуални данни. Най-вероятната непосредствена последица е по-широко тестване през DeepSeek и OpenRouter, а не незабавна промяна в подреждането на водещите модели. Моделът вече е достъпен и евтин за използване, но остава неясно дали действително се доближава до Claude Opus 4.8 на Anthropic, защото независима лаборатория още не е възпроизвела сравнението.

DeepSeek, лаборатория за изкуствен интелект (AI) от Ханджоу, пусна DeepSeek-V4-Flash-Vision-Exp на 21 август. Неговият интерфейс за програмиране на приложения (API) — онлайн услугата, чрез която софтуерът подава задачи към модела — работи под името model='deepseek-v4-flash-vision-exp'. Според DeepSeek способностите му за работа с текстови задачи, логически разсъждения и общи знания остават сравними с тези на V4 Flash. Семейството V4 Flash използва разредена архитектура от множество специализирани части, при която за всяка част от входа се задейства само част от целия модел: общо 284 млрд. параметъра и около 13 млрд. активни за всеки токен. Контекстният прозорец е един милион токена, а архитектурата включва хибридни методи Compressed Sparse Attention и Heavily Compressed Attention и Manifold-Constrained Hyper-Connections. DeepSeek не е публикувала технически доклад за Vision-Exp, точен брой параметри, описание на системата за обработка на изображения или начина, по който тя е свързана с езиковия модел. Затова определянето на самия Vision-Exp като модел с точно 284 млрд. общи и 13 млрд. активни параметъра остава извод по аналогия с V4 Flash, а не официално разкрит факт.

API приема изображения JPEG, PNG, GIF и WebP като кодирани base64 данни, чрез външни интернет адреси или чрез новия Files API. Всяко изображение се преоразмерява, преди моделът да го обработи. По-големите изображения се намаляват до площ, приблизително равна на 800×800 пиксела, а за всяко изображение се начисляват най-много 384 входни токена. Една заявка може да съдържа до 600 изображения. Прякото изображение е ограничено до 32 MiB, едно изображение чрез Files API — до 64 MiB, а общият размер при използване на файлове — до 200 MiB. Един акаунт може да поддържа до 2500 едновременни заявки. Токените от изображения се таксуват по цените на V4 Flash: 0,22 долара за милион некеширани входни токена и 0,66 долара за милион изходни токена извън пиковите часове, а в пиковите часове цените се увеличават до съответно 0,44 и 1,32 долара. Входът при попадение в кеша струва 0,007/0,014 долара за милион токена. При тавана от 384 токена DeepSeek изчислява, че некешираният вход от едно изображение струва най-много около 0,000084 долара извън пиковите часове и 0,000169 долара в пиковите, без разходите за текст и генерирания отговор.

Как се разви

02

Езиковият модел е известен, визуалната част остава неразкрита

2026-04-25 – 2026-08-20

Vision-Exp стъпва върху подробно описан езиков модел, но добавя визуална система, за която DeepSeek не е публикувала технически подробности. Техническият доклад за V4 описва V4 Flash като модел с множество специализирани части и общо 284 млрд. параметъра, от които около 13 млрд. се активират за всеки токен. Той има контекстен прозорец от един милион токена, хибридни методи CSA/HCA, които намаляват количеството информация, което моделът трябва да държи едновременно в полезрението си, връзки mHC и метода за оптимизация Muon. Обучението е проведено върху повече от 32 трлн. токена предварителни данни. Изданието V4-Flash-0731 от 31 юли запази същата основна структура и добави speculative decoding — техника за ускоряване на генерирането чрез предварително предвиждане на следващите части от отговора. На 21 август DeepSeek заяви, че Vision-Exp запазва текстовите способности на V4 Flash и добавя разбиране на изображения, но не публикува параметрите на Vision-Exp, визуалния енкодер, свързващия мултимодален модул, данните за обучение, разпределението на специализираните части или евентуално увеличение на броя параметри. OpenRouter определя модела като разредена система с 284 млрд. общи и 13 млрд. активни параметъра, но това е информация от външната услуга за маршрутизиране, а не ново техническо разкритие от DeepSeek.

03

Евтината обработка на изображения разчита на силно свиване

2026-08-16 – 2026-08-20

Четири дни преди премиерата на Vision-Exp влязоха в сила новите пикови и извънпикови цени за V4. Vision-Exp използва тарифата на V4 Flash, без отделно доплащане за изображения. Изображенията се превръщат в обикновени таксувани входни токени и са ограничени до 384 токена за файл след преоразмеряване. Изображенията с по-малко от приблизително 384×384 пиксела се увеличават, а по-големите се намаляват към бюджет, равностоен на около 800×800 пиксела; при detail='low' те се свиват до 512×512. Това прави многократната работа със снимки на екрана и документи евтина, но може да загуби подробности при дребен текст в интерфейси, плътни графики и задачи, изискващи много точни визуални координати. Преките изображения са ограничени до 32 MiB, файловете през Files API — до 64 MiB, а една заявка може да съдържа до 600 изображения. При 15 или повече изображения максималната дължина на една страна намалява от 8192 на 4096 пиксела.

01

DeepSeek пуска публично интерфейса за изображения

2026-08-20 – 2026-08-20

Премиерата дойде от самата DeepSeek, а не чрез изтичане на информация. Най-ранното проверимо съобщение, установено в проучването, е публикация на DeepSeek в X от 2026-08-21 09:17:38 UTC; второ съобщение на компанията последва около две секунди по-късно. Страницата за пускането на API и дневникът с промените също бяха публикувани същия ден. Китайски профили в социалните мрежи забелязаха новия интерфейс в рамките на минути, а материал на Cailian Press, запазен от Sina, се появи в 17:31:34 ч. китайско стандартно време. Проучването не откри данни външен журналист да е публикувал информация за модела преди DeepSeek.

04

Твърдението за резултати близо до Opus изпреварва доказателствата

2026-08-20 – 2026-08-20

Графиката с тестови резултати на DeepSeek превърна премиерата в пряко сравнение с Anthropic. В четири теста за агенти, зависещи от обработката на изображения, Vision-Exp и Claude Opus 4.8 си поделят победите по 2:2. DeepSeek води с 27,3 срещу 25,7 на Agents' Last Exam и с 35,0 срещу 34,0 при ZeroBench Pass@5, докато Opus е напред с 39,4 срещу 36,5 на ApexBench и с 65,0 срещу 64,3 на Chartography. Пълната таблица обаче е по-благоприятна за Opus. TNW преброи само три победи за Vision-Exp в 11 сравнения, включително изоставане от 12 точки на NL2Repo и 8,1 точки на DSBench-Hard. DeepSeek посочва, че публичните ѝ тестове на агенти за програмиране използват DeepSeek Harness в minimal mode — настройката, която определя как агентът работи — с максимално усилие за разсъждение и параметри top_p=0.95 и temperature=1.0. Съобщението при премиерата не установява, че всички резултати на Opus са били измерени едновременно и при същите условия.

05

Публичните проверки още не потвърждават сравнението

2026-08-20 – 2026-08-21

Независимите тестове все още не са настигнали премиерата. Публичната класация DeepSWE на Datacurve, последно обновена преди появата на Vision-Exp, не съдържа резултат за новия модел. Независимият резултат за Opus 4.8 Max е около 59% — близо до, но не точно същият като стойността 58,0 в таблицата на DeepSeek. При Chartography разминаването е по-голямо. Surge AI, създателят на теста, го определя като набор от 100 професионални задачи за разчитане на графики без външни инструменти, посочва 45% като най-добрия резултат на тестваните конфигурации и в момента показва Claude Opus 4.8 Adaptive/Max с 15,9%. DeepSeek обаче публикува 64,3 за Vision-Exp и 65,0 за Opus 4.8, без да уточни по коя метрика или методика на Chartography са получени тези стойности. Затова публичната класация не позволява сравнението да бъде възпроизведено. Различен протокол, версия или начин на оценяване може да обясни разликата, но за независима проверка DeepSeek или Surge AI трябва да публикуват подробности за съпоставими тестови изпълнения.

Докъде стигна историята

Към 2026-08-22 09:22 Europe/Sofia DeepSeek-V4-Flash-Vision-Exp е реално работещ експериментален модел през API, а не предварително съобщена или непотвърдена версия. Той приема текст и изображения, автоматично преоразмерява изображенията, начислява най-много 384 входни токена за всяко от тях, позволява до 600 изображения в една заявка, поддържа повторно използване чрез Files API и допуска 2500 едновременни заявки на акаунт при цените на V4 Flash, които се променят според часа. OpenRouter вече предлага достъп. DeepSeek не е публикувала параметрите на Vision-Exp, технически доклад, описание на визуалния енкодер, подробности за обучението, дата за производствена версия или изричен брой параметри за този вариант.

Сравнението с Claude Opus 4.8 остава обещаващо твърдение на DeepSeek, а не независимо установено подреждане на моделите. Четирите мултимодални теста на компанията завършват 2:2, но пълната ѝ таблица дава предимство на Opus в осем от 11 теста. Няма публикуван независим повторен тест на Vision-Exp при съпоставими условия, а стойностите за Chartography не съвпадат с публичните резултати на създателя на теста. Claude Opus 4.8 вече не е и най-новият модел Opus на Anthropic: компанията пусна Claude Opus 5 на 24 юли. Въпросът може да бъде решен с технически доклад или публикувани параметри на Vision-Exp, подробна методика за тестовете, резултати от организациите зад самите тестове и контролирани сравнения както с Opus 4.8, така и с Opus 5.