Моделът на Alibaba изостава от Claude Opus след резултат 52 точки на тестоветегенерирано с ИИПотвърдено
AI модели

Моделът на Alibaba изостава от Claude Opus след резултат 52 точки на тестовете

По-компактният софтуер с изкуствен интелект работи гладко на персонални компютри, но все още не успява да измести водещите облачни системи в индустрията.

Публикувано
NRB — News Republic Brigade

Историята продължава

Същината

Новият модел с изкуствен интелект на Alibaba, Qwen3.8-27B, вече може да се изпълнява директно на потребителски лаптопи и смартфони благодарение на напреднали методи за компресия. Въпреки това твърденията, че той превъзхожда водещите търговски облачни системи като Claude Opus 5 на Anthropic, се опровергават от независимите тестове.

Акценти

  • PrismML успя да компресира модел с 27 милиарда параметъра до базов обем от 3,9 GB, който се побира в паметта на мобилен телефон.
  • Alibaba предостави безплатен отворен лиценз за модела Qwen3.8-27B за персонални компютри.
  • Независимата изследователска фирма Artificial Analysis оцени Claude Opus 5 с 63 точки спрямо 52 точки за Qwen3.8-27B.
  • Модифициран софтуерен шаблон съкрати средното време за отстраняване на софтуерни грешки от 50,2 на 20,0 минути.

Сравнение на индекса за интелигентност

индексни точки
63
52
Claude Opus 5Qwen3.8-27B

щрихОблачният модел на Anthropic поддържа преднина от 11 точки пред компактната система на Alibaba в тази оценка.

  • Сравнението показва общите оценки за производителност между облачната услуга на Anthropic и модела на Alibaba за локално инсталиране.
  • Индекс за интелигентност — стандартизирана оценка за производителност, изчислена от независимата изследователска фирма Artificial Analysis
  • Разликата показва, че макар компактният локален софтуер да се развива с бързи темпове, водещите облачни системи запазват измеримо технологично предимство.

Из дневника на редактора

Компресирането на софтуер с изкуствен интелект прави локалните изчисления напълно приложими на лични устройства, но по-малките модели все още разчитат на комерсиалните облачни платформи за най-сложните задачи.

Кой участва

  • Екипът на Alibaba Qwen

    изследователското подразделение на Alibaba за софтуер с отворен код и изкуствен интелект

    цел → разработка на компактен софтуер, способен да се конкурира с водещите системи в сектора, докато работи на персонални компютри

  • PrismML

    технологичен стартъп, специализиран в свиването на сложни компютърни програми

    цел → демонстрация, че средни по размер модели с изкуствен интелект могат да работят локално на мобилни телефони и лаптопи

  • peculiar-ragdoll

    независим софтуерен тестер и разработчик от общността

    цел → повишаване на ефективността на локалните софтуерни инструменти и тяхното сравняване с платените комерсиални платформи

  • Artificial Analysis и независими експерти за бенчмарк

    независими групи, които оценяват производителността на компютърния софтуер чрез стандартизирани тестове

    цел → проверка дали придобили популярност твърдения за производителност се потвърждават при различни хардуерни конфигурации и работни натоварвания

  • Anthropic

    компания за изкуствен интелект, създател на семейството модели Claude

    цел → запазване на водещата позиция по производителност и търговската привлекателност на своите облачни модели

Накратко

Всеки потребител с висок клас лаптоп вече може да стартира усъвършенстван софтуер с изкуствен интелект директно на своето устройство, без да изпраща данни към корпоративни облачни сървъри. Тази промяна осигурява по-висока поверителност и намалява разходите за разработчиците, но не означава, че малките локални програми са задминали най-големите търговски платформи.

Най-вероятният изход е софтуерните инженери да използват компактните модели за ежедневни, рутинни задачи по програмиране на личните си компютри, като същевременно разчитат на мощните облачни услуги за най-сложните работни процеси.

Този преход е напълно постижим, тъй като локалните модели вече осигуряват бърза и практична работа на потребителски хардуер. В същото време тяхната ефективност остава твърде непостоянна при различни тестови конфигурации, за да заменят напълно платените корпоративни решения.

Предистория

Как се разви

01

Компактен модел с изкуствен интелект работи на смартфон

2026-07-08 – 2026-07-08

Технологичен стартъп успя да компресира модел с изкуствен интелект от 27 милиарда параметъра така, че да се побере изцяло в оперативната памет на iPhone 17 Pro. Демонстрацията доказа, че сложен софтуер, доскоро ограничен единствено до гигантските центрове за данни, вече може да се изпълнява локално на стандартни потребителски устройства.

2 източника
02

Свиване на софтуера до размери за мобилна памет

2026-07-13 – 2026-07-15

PrismML публикува програмния код на компресираната си система Bonsai 27B, предоставяйки на външни разработчици възможност да проверят как тя се побира в мобилен хардуер. Публикуваната документация изясни, че работата върху смартфон изисква специализирани методи за компресия, които намаляват прецизността на математическите тегла на модела до малко над един бит за всяко от тях.

5 източника
03

Alibaba представи по-нов модел за персонални компютри

2026-08-13 – 2026-08-16

Alibaba пусна по-новата си система Qwen3.8-27B и предостави файловете за свободно изтегляне и изпълнение на преносими компютри. Компанията публикува резултати от тестове, показващи, че моделът превъзхожда по-стари версии на комерсиални облачни платформи при редица инженерни задачи по програмиране.

5 източника
04

Онлайн твърдения разпалиха дебат за поправката на софтуерни грешки

2026-08-17 – 2026-08-17

Независим програмист обяви в интернет, че 22-гигабайтова версия на модела на Alibaba превъзхожда флагманската облачна услуга Claude Opus 5 на Anthropic при отстраняването на софтуерни дефекти. Публикацията бързо доби огромна популярност сред разработчиците, но последвалите коментари показаха, че тестът е разчитал на персонализирани модификации и не е съдържал данни за използвания компютърен хардуер.

4 източника
05

Противоречиви резултати поставиха под съмнение категоричната победа

2026-08-18 – 2026-08-19

Опитите на други разработчици да повторят нашумелия експеримент доведоха до силно противоречиви резултати. Моделът на Alibaba се представи стабилно на лаптопи от висок клас, но постигна победи в едни тестови задачи и понесе загуби в други в зависимост от конкретното задание.

3 източника
06

Помощните софтуерни инструменти променят представянето на различните машини

2026-08-22 – 2026-08-23

Последващите тестове доказаха, че спомагателните приложения, използвани за изпълнение на моделите, оказват решаващо влияние върху резултатите. Един и същ модел успяваше или се проваляше при генериране на код единствено след смяна на обслужващия инструмент. Това доказа, че единични изолирани бенчмаркове не могат да служат като доказателство за пазарно превъзходство.

4 източника

Докъде стигна историята

Общественият дебат съчета две напълно отделни технически постижения. От една страна, PrismML доказа, че по-стар модел на Alibaba може да бъде компресиран до размер от 3,9 GB и да работи на iPhone 17 Pro Max, макар обявената скорост от 11 токена в секунда все още да не е потвърдена от независими изпитвателни лаборатории.

От друга страна, твърдението, че по-новият 22-гигабайтов модел на Alibaba превъзхожда Claude Opus 5 на Anthropic, остава недоказано. Макар Qwen3.8-27B да работи гладко на съвременни персонални компютри, независимите оценки отреждат категорична преднина за Claude Opus 5 с резултат от 63 спрямо 52 точки. За да се разрешат бъдещите спорове за производителност, ще бъдат необходими прецизни и стандартизирани тестове при напълно оповестен хардуер.

Източници

  • WavectBonsai technical review · 2026-07-16
  • oMLXfresh 4-bit Apple-silicon performance · 2026-08-24