HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI готова быстро последовать за Jev

Hacker News •
×

Jev от Type Safe представил новую вариацию больших языковых моделей, которая потрясла мир ИИ. Согласно Vercel, «Jev был принят быстрее, чем любая другая модель в истории AI Gateway». Но тучи сгущаются. OpenAI, несомненно, обращает внимание – и решает, что делать дальше. Я желаю Type Safe всего наилучшего, но если они действительно выполнят свои обещания, то я обеспокоен, что OpenAI хорошо позиционирована для быстрого повторения – не только для копирования флагманского продукта Jev, но и для включения этой возможности в будущие модели и агенты и предложения действительно полезного нового поведения, которое Jev не в состоянии воспроизвести.

OpenAI годами использовала свои LLM в качестве неявных классификаторов; они просто не обучали их для общих задач классификации и не упаковали общую классификацию как отдельный продукт. Если OpenAI сможет воспроизвести обучение, то сможет воспроизвести Jev в короткие сроки. Более того, OpenAI может использовать этот новый классификатор внутри своих существующих моделей и агентов, что может быть полезно для быстрого выбора модели, более эффективного мышления, лучших защитных барьеров и в целом более умных, быстрых и дешёвых моделей.

Ключевой фактор, определяющий всё это, – есть ли у Type Safe рвов. Самый большой ров, который я вижу, – в обучающих данных и процессах обучения Type Safe. Моё основное предположение состоит в том, что Jev использует нечто весьма близкое к обычной большой языковой модели. В качестве доказательства Latent Space сообщает, что многие ранние клоны действительно основаны на LLM. Получив состояние и набор вопросов, LLM Jev генерирует один токен или, точнее, генерирует распределение вероятностей по всем возможным следующим токенам. Logprobs, связанные с каждым возможным токеном на этом шаге, затем преобразуются в формат, который Jev должен вернуть. Для вопроса noul Jev смотрит только на два токена, true и false, игнорирует всё остальное и нормализует их вероятности в единую вероятность того, что ответ true. Для вопроса выбора Jev можно подсказать список возможностей, и он смотрит на относительные вероятности этих токенов, чтобы построить полное распределение, выбирая наивысшую как победителя. Шаблон выбора почти такой же, как я писал в блоге в 2025 году в Supercharging LLM Classifications with Logprobs, и даже без тонкой настройки он уже показывал перспективность. Я не глубоко задумывался о примитиве score, но подозреваю, что это вариант того же шаблона. Часть предпосылки этого поста заключается в том, что OpenAI может быть готова быстро воспользоваться этой идеей, и это становится яснее, если вы понимаете, как. OpenAI использует большие языковые модели неявно как специализированные классификаторы, по крайней мере, с момента появления вызова инструментов. В начале 2024 года я написал Tool Invocation – Demonstrating the Marvel of GPT's Flexibility, где я заставил модель GPT раскрыть, как именно она решает вызвать инструмент. Вот как выглядит сессия чата изнутри. Здесь есть сообщение пользователя, затем ответ ассистента без вызова инструмента, за которым следует сообщение пользователя с вызовом инструмента: Я раскрасил текст, чтобы указать границы токенов. Если вы раньше не видели Chat ML, это внутренний язык разметки, который OpenAI представила для организации подсказок диалога пользователь-агент. и – это зарезервированные токены, которые разделяют сообщения, а первый токен после идентифицирует говорящего: пользователя или ассистента. Сразу после assistant, ve...