Люди зі штучного інтелекту зараз говорять про нові види моделей. Це неавторегресійна, негенеруюча текст, надшвидка архітектура імовірнісного прогнозування для структурованих схем. Коли я бачу ажіотаж в Інтернеті, я відчуваю себе виправданим і надзвичайно розчарованим. Я почав працювати над цим буквально рік тому, у березні 2025 року. Ми витратили місяці важкої роботи, поту та безсонних ночей […]
Люди зі штучного інтелекту зараз говорять про нові види моделей. Це неавторегресійна, негенеруюча текст, надшвидка архітектура імовірнісного прогнозування для структурованих схем.
Коли я бачу ажіотаж в Інтернеті, я відчуваю себе виправданим і надзвичайно розчарованим.
Я почав працювати над цим буквально рік тому, у березні 2025 року. Ми витратили місяці важкої роботи, поту та безсонних ночей на його створення, публікацію статті arXiv (arXiv:2503.23303), випуск моделей ваги на Hugging Face (sales-conversion-model-reinf-learning), публікацію відкритого набору даних (saas-sales-conversations), створення пакета PyPI та опублікувати весь підхід на Reddit. (обговорення r/LocalLLaMA).
Потім, у вересні 2025 року, ми опублікували другу статтю (arXiv:2510.01237), яка формалізувала структуру для прийняття рішень на основі схеми на основі навчання з підкріпленням. Мозком, яким керувала моя система, завжди було навчання з підкріпленням, а не лише вбудовані моделі чи авторегресійні LLM.
А у вересні 2026 року добре фінансована Frontier Lab під назвою TypeSafe AI (засновник Діого Алмейда, співвинахідник OpenAI’s ChatGPT) запустила Jev. Вони запропонували ту саму концепцію неавторегресійного прийняття рішень, ніби це був абсолютно новий науковий прогрес. За винятком того, що він був запущений без технічної документації, нульових публічних ваг і нульових загальнодоступних навчальних наборів даних.
У моїй попередній моделі використовувалося представлення PPO над послідовністю для виведення покрокових траєкторій конверсії (імовірності від 0,0 до 1,0) у вертикальних розмовах про продаж. Jev узагальнює паралельну вибірку, використовуючи щось під назвою RLCD (Reinforcement Learning for Calibrated Decisions) для горизонтального виведення розподілів достовірності та вибору схем, стягує 0,042 доларів США за мільйон вхідних токенів і має типовий час відповіді приблизно 150 мілісекунд.
Замість того, щоб залишатися озлобленим, я вирішив взяти все, що навчився, виправити всі архітектурні обмеження старого підходу та побудувати повністю відкриту та горизонтальну сімейство моделей рішень System 1. Рая.
Крім того, оскільки ми правильно створили двонаправлений кодер, наша модель працює в такому середовищі: 32,8 мс на одному GPU (7,2 мс на пакетне запитання)роблячи це У 6-8 разів швидше, ніж Jevповністю підтримує понад 100 мов, не має вартості підписки на API і є на 100% відкритим кодом із вагою Apache 2.0.
1. Основне пізнання: Система 1 і Система 2
Усі сучасні конвеєри ШІ мають великі вузькі місця. Ми використовуємо генеративний LLM для простих рефлексивних рішень.
Коли надходить запит у службу підтримки клієнтів, електронний лист у вашу папку «Вхідні» або користувач запитує ваш API, вам зазвичай потрібно лише відповісти на просте, структуроване запитання.
- В який відділ відправити цей квиток?
- Цей отриманий електронний лист є фішинговою атакою чи спамом?
- Це підказка намагається здійснити джейлбрейк або вставити інструкції?
- Наскільки актуальною є ця проблема в порядковій рубриці (0-3)?
- Чи вимагає цей запит виконання коду чи проста відповідь, заснована на фактах?
Виклик 8B, 70B або LLM, створений на кордоні, для цього абсолютно надмірно. Вам потрібно почекати від 500 до 2000 мс, щоб токен вийшов, витратити реальні гроші на висновок, а потім написати регулярний вираз або аналізатор JSON, щоб отримати чисті мітки з тексту довільної форми. Найгірше те, що магістратури люблять створювати ілюзії та помилкову впевненість. На виході LLM "confidence: 0.95"це просто передбачення токена, який звучить впевнено. За цим стоїть нульове математичне калібрування.
Нам потрібна була модель, яка поводилася б як система 1 людського мозку, приймаючи миттєві рефлексивні рішення з чесними умовними ймовірностями, які займають лише 30-35 мілісекунд на стандартному апаратному забезпеченні.
2. Три примітиви рішення
Laya оцінює введені запитання за будь-яким станом (необроблений текст, електронна пошта, квиток або документ JSON). один пас вперед. Це залежить від трьох примітивів.
- вибір: виберіть один варіант зі словника критеріїв. Повертає вибраний ключ, розподіл ймовірностей за всіма параметрами та скоригований показник достовірності.
- Оцінка: розмістіть стани в порядковій рубриці (рівні 0, 1, 2,…). Повертає рівень очікування, розподіл за рангами рубрик і впевненість.
- Ноул: пряме логічне запитання, яке повертає відкалібровану ймовірність P(true) між 0,0 і 1,0 (за побудовою P(false) = 1 – P(true)).
Оскільки вихідний простір складається виключно з ймовірностей і чисел, модель не може генерувати текст або галюцинувати, а порушення схеми та неправильний формат JSON фізично неможливі.
3. Три контрольно-пропускні пункти та архітектура зв’язаного концентратора
Жодна модель не може найкраще підходити для всіх завдань або мов. Ми випустили три спеціалізовані контрольно-пропускні пункти, які тепер об’єднані в єдиний центр сховища на Hugging Face.
Завантажте вибрану вкладену папку
Замість того, щоб змушувати користувачів керувати трьома окремими репозиторіями та завантажувати загальну вагу 2,5 ГБ, основне сховище convaiinnovations/Рая З’єднайте всі три. Використання обличчя обійми allow_patternsПакет SDK Laya завантажує лише потрібні вкладені папки.
# Downloads English model (~808 MB)
agent_en = laya.load("convaiinnovations/laya")
# Downloads ONLY the multilingual subfolder (~647 MB), not the entire 2.5 GB bundle
agent_ml = laya.load("convaiinnovations/laya", subfolder="multilingual")
4. Чому маршрутизація є важливою: реальність мультискриптів
Одним із найдивовижніших результатів аналізу 51 мови в тесті MASSIVE (20 варіантів, випадкова базова лінія = 0,050) стало те, що англійська модель не працює з нелатинськими шрифтами.
Словник BPE англійської мови ModernBERT-large із 50 000 токенів просто подрібнює нелатинські символи.
- кхмерська: 0,000 точність 0,952 Середня надійність. Хоча зі 100 питань не було прийнято жодного правильного рішення, надійність, як повідомляється, становить приблизно 95%.
- вірменська: Точність 0,050 з достовірністю 0,885 (точне випадкове підкидання монети).
- Іврит: Точність 0,060 з достовірністю 0,964.
- Бенгальська: Точність 0,080 з достовірністю 0,945.
- Хінді: Точність 0,100 з достовірністю 0,941.
Це важливий урок. Рівень достовірності самої моделі не видає жодних попереджень, якщо вхідний сценарій неможливо прочитати.. Для 51 мови середня надійність контрольних точок англійською мовою ніколи не була нижчою за 0,885, незалежно від того, чи становить точність 82% чи 0%.
отже, Trust Gates не захистить вас. Потрібно визначитися, яку модель використовувати попереду пас вперед.
Субмілісекундна чиста маршрутизація Python
Laya містить вбудовані компоненти Router Він перевіряє сценарій Unicode вхідного тексту в 22 алфавітах (деванагарі, CJK Han, кирилиця, арабська, іврит, тамільська, тайська тощо) і аналізує розподіл латинських стоп-слів.
- Стандартний англійський текст: 0,09 мс Накладні витрати на виявлення.
- Деванагарі / індійський текст: 0,54 мс Накладні витрати на виявлення.
- Великий вкладений документ JSON із 200 рядками: 0,73 мс Накладні витрати на виявлення.
Порівняно з прямим шляхом 33 мс витрати на маршрутизацію незначні (<2%). і, Router(preload=True)усі необхідні моделі зберігаються у VRAM/RAM, що повністю усуває 7-10-секундну покарання холодної заміни під час перемикання трафіку між мовами.
from laya import Router
# Preload checkpoints into memory for instant sub-35ms routing
router = Router(preload=True)
# English -> automatically routed to ModernBERT-large
res_en = router.predict({"body": "I was charged twice, please refund."}, questions)
# Hindi -> automatically routed to mmBERT-base (100+ languages)
res_hi = router.predict({"body": "मुझसे दो बार शुल्क लिया गया, कृपया पैसे वापस करें।"}, questions)
# Explicit override when you already know the domain
res_spec = router.predict(state, questions, model="typed-decisions")
5. Личний бій: Лайя (з маршрутом) проти TypeSafe Jev
Ми порівнювали Laya безпосередньо з TypeSafe Jev у загальнодоступних наборах даних і стандартних тестах. Кожне число Raya вимірюється. Числа Jev опубліковані сторонніми незалежними дослідженнями (AbdelStark, nibzard) і TypeSafe AI.
| Орієнтири/метрики | TypeSafe Jev 1.13.0 | Рая (вкорінена) | Перевага/Дельта |
|---|---|---|---|
| Типові рішення (2000 рішень) | 0,727 | 0,766 | +3,9% (вище ліміту вчителя 0,735) |
| AG News (4 етикетки) | 0,910 | 0,950 | +4,0% вища точність |
| DAIR Emotion (6 етикеток) | 0,480 (Брі 0,846) | 0,595 | +11,5% вище (ймовірність Джева була 16%) |
| Помилка калібрування (ECE) | 0,246 | 0,081 | Калібрування ймовірності покращено в 3 рази |
| Затримка P50 (1 запитання) | 236 – 276 мілісекунд | 32,8 мс | Працює в 7,8 разів швидше |
| Затримка P50 (пакет із 10 питань) | ~1500 мс (послідовний) | 72,3 мс (7,2 мс/к) | У 20 разів швидше завдяки пакетним викликам |
| Доступні мови (> 3x випадково) | Немає опублікованих контрольних показників | 45 з 51 мови | Охоплює мови по всьому світу |
| Ціна за мільйон токенів | 0,042 дол. США (API оплати за використання) | 0,00 дол. США (самостійне розміщення) | Повністю безкоштовний Apache 2.0 |
| Вага та код моделі | Закритий оригінальний API | відкритий код safetensor | Повітряний проміжок і локальна сумісність |
Реальний робочий процес програми
Laya продемонструвала якість готових рішень у дев’яти оцінених робочих процесах підприємства.
- Фільтр спаму в електронній пошті (Enron): 0,993 точність0,993 F1, 0,013 ECE.
- Виявлення фішингу: 0,980 точність0,979 F1, 0,012 ECE.
- LLM Guardrails і Jailbreak (збереження ToxicChat): Точність 0,755 – 0,762. Точність наступного рівня з 50% вибірковим покриттям 0,931.
- Фільтрація, пов’язана з проходом RAG: Точність 0,657 з одним пасом вперед.
- Підтримує маршрутизацію черги квитків (10 напрямків): 0,522 точність.
6. Чесні межі: Коли Лая має стелю
Занадто багато анонсів штучного інтелекту приховує його слабкі сторони. Ми віримо в інженерну чесність.
- Питання з декількома відповідями погіршуються, коли є більше 20 варіантів. У стрес-тесті Banking77 (77 етикеток) оцінка Лаї склала 0,425, а оцінка Джева — 0,870. Це обмеження архітектурного бюджету. Опціони поділяють від 192 до 256 токенів.
head_max_lenБюджет обмежений, залишаючи лише 3-4 жетони на кандидата для 77 варіантів. рекомендація: Зберігайте схему вибору до 20 варіантів або використовуйте дворівневу ієрархію від грубої до тонкої. - Нульовий знімок і точне налаштування: Готова базова модель має контрольний показник надрукованого рішення ~0,35 (майже випадковий). Оцінка 0,766 досягнута шляхом налаштування еталонного розподілу поїздів. Ставтеся до Лаї не як до всезнаючого оракула з нульовим ударом, а як до швидкої базової моделі для спеціалізації.
- Калібрування температури: Основні ваги постачаються з необробленими логітами температури. Підгонка однієї скалярної температури для кожного типу запитання до розподілу домену зменшує очікувану помилку калібрування з 0,466 до 0,081.
7. Швидкий старт: запустіть Laya за 30 секунд
pip install laya>=0.3.3
Нижче наведено повний приклад використання автоматичної мовної маршрутизації для прийняття рішень щодо кількох схем.
import laya
from laya import Router
# Initialize router with preloading (avoids swap delay)
router = Router(preload=True)
# Define complex state
ticket = {
"ticket_id": "TCK-8821",
"customer": "enterprise_user",
"subject": "System downtime and billing dispute",
"body": "Our production API has been failing since 6 AM. We lost critical transactions. We demand an immediate SLA refund."
}
# Define multiple questions of different primitives
questions = {
"queue": {
"type": "choice",
"instructions": "Which engineering queue owns this ticket?",
"criteria": {
"infrastructure": "server outages, network downtime, database failures",
"billing": "refunds, SLA credits, invoice disputes",
"security": "breaches, vulnerability reports",
"support": "general customer inquiries"
}
},
"urgency": {
"type": "score",
"instructions": "How urgent is this ticket?",
"criteria": ["low priority", "medium", "high priority", "critical blocker"]
},
"churn_risk": {
"type": "noul",
"instructions": "Does the customer threaten to cancel or express severe churn intent?"
}
}
# Single forward pass: evaluates all questions simultaneously
res = router.predict(ticket, questions)
print("Routing Decision :", res["routing"]["model"])
# -> english
print("Assigned Queue :", res["answers"]["queue"]["choice"])
# -> infrastructure (confidence: 0.96)
print("Urgency Score :", res["answers"]["urgency"]["score"])
# -> 2.87 / 3.0
print("Churn Risk :", f"{res['answers']['churn_risk']['noul']:.1%}")
# -> 91.4%
8. Ресурси та спільнота
- Центр моделі обличчя в обіймах: convaiinnovations/Рая (Зберігати всі 3 контрольні точки)
- Живий інтерактивний простір: convaiinnovations/laya-demo (Спробуйте 8 робочих процесів і багатомовну маршрутизацію на ZeroGPU)
- Репозиторій GitHub: github.com/NandhaKishorM/laya (Код, маршрутизатор і джгут відтворюваних тестів
researchвідділення) - Пакети PyPI: pip встановити Laya
- Ноутбук Kaggle 2xT4 Tweak: laya_finetune_typed_decisions_2xT4_kaggle.ipynb (Навчіть свої власні моделі System 1 до 4 годин за допомогою безкоштовних графічних процесорів Kaggle)
висновок
Від публікації arXiv у березні 2025 року до сьогодні минув рік досліджень, але основне розуміння залишається незмінним. Не для кожної проблеми ШІ потрібен авторегресивний чат-бот.
Для великого обсягу класифікації, огорожі, маршрутизації та сортування двонаправлена модель прийняття рішень під 35 мс, навчена на RLCD, забезпечує виконання в 7,8 разів швидше, ніж її власна альтернатива, нульові галюцинації, глобальну мовну маршрутизацію та чесні показники впевненості, які фактично можуть розгалужуватися у робочому коді.
Найкраще те, що це 100% відкритий код для всієї спільноти.