HeadlinesBriefing HeadlinesBriefing 12 languages

How accurately calibrated is Jev?

Hacker News ·

🇬🇧 English

Jev is Type Safe’s new “System One” classifier model. The name is inspired by Daniel Kahneman’s book Thinking, Fast and Slow, in which he distinguishes between fast, instinctive, System One thinking and slower, conscious, System Two thinking. Large Language Models (LLMs) like Claude or GPT are System Two models and “Decision Models” like Jev and its predecessors (e.g. Laya) are System One.

Jev takes a pretrained transformer and bolts a classifier on the end, allowing it to use new context immediately while acting as a classifier. You give it context and a multiple-choice question, and it returns a probability distribution over the multiple choices. The entire below series of experiments cost less than $4.00.

I tested Jev's calibration using well-understood physical distributions, like the Maxwell-Boltzmann distribution. I picked 10 candidate distributions, 5 prompt templates per distribution, and 20 variations per prompt, giving 1,000 settings total. GPT-6 Astra and Claude Opus 5.5 were used for implementing the experiments, writing templated prompts, and API calls.

View original article →


🇸🇦 العربية

ما مدى دقة معايرة Jev؟

Jev هو نموذج المصنف "System One" الجديد من Type Safe. الاسم مستوحى من كتاب Daniel Kahneman بعنوان Thinking, Fast and Slow، حيث يميز بين التفكير السريع والغريزي في النظام الأول والتفكير الأبطأ والواعي في النظام الثاني. نماذج اللغة الكبيرة (LLMs) مثل Claude أو GPT هي نماذج System Two، بينما "نماذج القرار" مثل Jev وسابقاتها (مثل Laya) هي System One.

يأخذ Jev محولًا مدربًا مسبقًا ويضيف مصنفًا في نهايته، مما يسمح له باستخدام سياق جديد فورًا بينما يعمل كمصنف. تعطيه سياقًا وسؤالًا متعدد الخيارات، فيعيد توزيع الاحتمالات على الخيارات. كلفت سلسلة التجارب بأكملها أقل من 4.00 دولارات.

اختبرت معايرة Jev باستخدام توزيعات فيزيائية معروفة جيدًا، مثل توزيع Maxwell-Boltzmann. اخترت 10 توزيعات مرشحة، و5 قوالب مطالبة لكل توزيع، و20 تغييرًا لكل مطالبة، مما يعطي 1,000 إعدادًا إجمالاً. تم استخدام GPT-6 Astra وClaude Opus 5.5 لتنفيذ التجارب وكتابة قوالب المطالبات واستدعاءات API.

كيف يختلف Jev عن نماذج LLM مثل Claude أو GPT؟

Jev هو نموذج مصنف System One يأخذ محولًا مدربًا مسبقًا ويضيف مصنفًا في نهايته، ويعيد توزيع الاحتمالات على خيارات متعددة. في المقابل، نماذج LLM مثل Claude أو GPT هي نماذج System Two عشوائية وتوليدية وتنتج نصًا حرًا غير مناسب لمهام التصنيف.

العربية version →


🇧🇩 বাংলা

Jev কতটা সঠিকভাবে ক্যালিব্রেটেড?

Jev হল Type Safe-এর নতুন "System One" ক্লাসিফায়ার মডেল। নামটি Daniel Kahneman-এর বই Thinking, Fast and Slow থেকে অনুপ্রাণিত, যেখানে তিনি দ্রুত, সহজাত System One চিন্তা এবং ধীর, সচেতন System Two চিন্তার মধ্যে পার্থক্য করেছেন। Claude বা GPT-এর মতো বড় ভাষার মডেল (LLM) হল System Two মডেল, আর Jev এবং এর পূর্বসূরি (যেমন Laya) হল System One।

Jev একটি প্রাক-প্রশিক্ষিত ট্রান্সফরমার নেয় এবং তার শেষে একটি ক্লাসিফায়ার যুক্ত করে, যা তাৎক্ষণিকভাবে নতুন প্রসঙ্গ ব্যবহার করতে দেয় যখন এটি ক্লাসিফায়ার হিসেবে কাজ করে। আপনি এটিকে প্রসঙ্গ এবং একটি বহুনির্বাচনী প্রশ্ন দেন, এবং এটি বিকল্পগুলির উপর একটি সম্ভাব্যতা বণ্টন ফেরত দেয়। নিচের পুরো পরীক্ষা সিরিজের খরচ $4.00-এর কম।

আমি Maxwell-Boltzmann বণ্টনের মতো সুপরিচিত শারীরিক বণ্টন ব্যবহার করে Jev-এর ক্যালিব্রেশন পরীক্ষা করেছি। আমি 10টি প্রার্থী বণ্টন, প্রতি বণ্টনে 5টি প্রম্পট টেমপ্লেট এবং প্রতি প্রম্পটে 20টি ভিন্নতা বেছে নিয়েছি, মোট 1,000টি সেটিংস। GPT-6 Astra এবং Claude Opus 5.5 পরীক্ষা বাস্তবায়ন, টেমপ্লেট প্রম্পট লেখা এবং API কলের জন্য ব্যবহৃত হয়েছে।

Jev কীভাবে Claude বা GPT-এর মতো LLM থেকে আলাদা?

Jev হল একটি System One ক্লাসিফায়ার মডেল যা একটি প্রাক-প্রশিক্ষিত ট্রান্সফরমার নেয় এবং শেষে একটি ক্লাসিফায়ার যুক্ত করে, একাধিক বিকল্পের উপর সম্ভাব্যতা বণ্টন ফেরত দেয়। বিপরীতে, Claude বা GPT-এর মতো LLM হল System Two মডেল যা স্টোকাস্টিক, অটোরিগ্রেসিভ এবং মুক্ত-পাঠ্য আউটপুট দেয় যা শ্রেণিবিন্যাস কাজের জন্য উপযুক্ত নয়।

বাংলা version →


🇩🇪 Deutsch

Wie genau ist Jev kalibriert?

Jev ist das neue „System One“-Klassifikatormodell von Type Safe. Der Name ist inspiriert von Daniel Kahnemans Buch Thinking, Fast and Slow, in dem er zwischen schnellem, instinktivem System-One-Denken und langsamerem, bewusstem System-Two-Denken unterscheidet. Große Sprachmodelle (LLMs) wie Claude oder GPT sind System-Two-Modelle, während „Entscheidungsmodelle“ wie Jev und seine Vorgänger (z. B. Laya) System One sind.

Jev nimmt einen vortrainierten Transformer und fügt am Ende einen Klassifikator hinzu, sodass er sofort neuen Kontext nutzen kann, während er als Klassifikator fungiert. Sie geben Kontext und eine Multiple-Choice-Frage, und er gibt eine Wahrscheinlichkeitsverteilung über die Optionen zurück. Die gesamte unten aufgeführte Versuchsreihe kostete weniger als 4,00 $.

Ich habe Jevs Kalibrierung mit gut verstandenen physikalischen Verteilungen wie der Maxwell-Boltzmann-Verteilung getestet. Ich wählte 10 Kandidatenverteilungen, 5 Prompt-Vorlagen pro Verteilung und 20 Variationen pro Prompt, was insgesamt 1.000 Einstellungen ergibt. GPT-6 Astra und Claude Opus 5.5 wurden verwendet, um die Experimente zu implementieren, Vorlagen-Prompts zu schreiben und API-Aufrufe durchzuführen.

Wie unterscheidet sich Jev von LLMs wie Claude oder GPT?

Jev ist ein System-One-Klassifikatormodell, das einen vortrainierten Transformer nimmt und am Ende einen Klassifikator hinzufügt, der eine Wahrscheinlichkeitsverteilung über mehrere Optionen zurückgibt. Im Gegensatz dazu sind LLMs wie Claude oder GPT System-Two-Modelle, die stochastisch, autoregressiv sind und Freitext ausgeben, der für Klassifikationsaufgaben nicht geeignet ist.

Deutsch version →


🇪🇸 Español

¿Qué tan calibrado está Jev?

Jev es el nuevo modelo clasificador "System One" de Type Safe. El nombre está inspirado en el libro de Daniel Kahneman, Pensar rápido, pensar despacio, donde distingue entre el pensamiento rápido e instintivo del Sistema Uno y el pensamiento más lento y consciente del Sistema Dos. Los modelos de lenguaje grandes (LLM) como Claude o GPT son modelos del Sistema Dos, mientras que los "modelos de decisión" como Jev y sus predecesores (por ejemplo, Laya) son del Sistema Uno.

Jev toma un transformer preentrenado y le añade un clasificador al final, permitiendo usar nuevo contexto inmediatamente mientras actúa como clasificador. Le das contexto y una pregunta de opción múltiple, y devuelve una distribución de probabilidad sobre las opciones. Toda la serie de experimentos costó menos de $4.00.

Probé la calibración de Jev usando distribuciones físicas bien conocidas, como la distribución de Maxwell-Boltzmann. Elegí 10 distribuciones candidatas, 5 plantillas de prompt por distribución y 20 variaciones por prompt, dando un total de 1,000 configuraciones. GPT-6 Astra y Claude Opus 5.5 se usaron para implementar los experimentos, escribir las plantillas y las llamadas API.

¿Cómo difiere Jev de los LLM como Claude o GPT?

Jev es un modelo clasificador System One que toma un transformer preentrenado y le añade un clasificador al final, devolviendo una distribución de probabilidad sobre múltiples opciones. En contraste, los LLM como Claude o GPT son modelos System Two que son estocásticos, autorregresivos y generan texto libre no adecuado para tareas de clasificación.

Español version →


🇫🇷 Français

Quelle est la précision de l'étalonnage de Jev ?

Jev est le nouveau modèle classificateur « System One » de Type Safe. Le nom est inspiré du livre de Daniel Kahneman, Thinking, Fast and Slow, dans lequel il distingue la pensée rapide et instinctive du Système Un et la pensée plus lente et consciente du Système Deux. Les grands modèles de langage (LLM) comme Claude ou GPT sont des modèles du Système Deux, tandis que les « modèles de décision » comme Jev et ses prédécesseurs (par exemple Laya) sont du Système Un.

Jev prend un transformateur pré-entraîné et y ajoute un classificateur à la fin, lui permettant d'utiliser immédiatement un nouveau contexte tout en agissant comme un classificateur. Vous lui donnez un contexte et une question à choix multiples, et il renvoie une distribution de probabilité sur les choix. Toute la série d'expériences ci-dessous a coûté moins de 4,00 $.

J'ai testé l'étalonnage de Jev en utilisant des distributions physiques bien connues, comme la distribution de Maxwell-Boltzmann. J'ai choisi 10 distributions candidates, 5 modèles de prompt par distribution et 20 variations par prompt, soit 1 000 réglages au total. GPT-6 Astra et Claude Opus 5.5 ont été utilisés pour implémenter les expériences, écrire les modèles de prompts et les appels API.

En quoi Jev diffère-t-il des LLM comme Claude ou GPT ?

Jev est un modèle classificateur System One qui prend un transformateur pré-entraîné et y ajoute un classificateur à la fin, renvoyant une distribution de probabilité sur plusieurs choix. En revanche, les LLM comme Claude ou GPT sont des modèles System Two qui sont stochastiques, autorégressifs et produisent du texte libre non adapté aux tâches de classification.

Français version →


🇮🇳 हिन्दी

Jev कितना सटीक रूप से कैलिब्रेटेड है?

Jev Type Safe का नया "System One" क्लासिफायर मॉडल है। यह नाम Daniel Kahneman की पुस्तक Thinking, Fast and Slow से प्रेरित है, जिसमें वे तेज़, सहज System One सोच और धीमी, सचेत System Two सोच के बीच अंतर करते हैं। Claude या GPT जैसे बड़े भाषा मॉडल (LLM) System Two मॉडल हैं, जबकि Jev और इसके पूर्ववर्ती (जैसे Laya) जैसे "निर्णय मॉडल" System One हैं।

Jev एक पूर्व-प्रशिक्षित transformer लेता है और उसके अंत में एक क्लासिफायर जोड़ता है, जिससे यह नए संदर्भ का तुरंत उपयोग कर सकता है जबकि यह एक क्लासिफायर के रूप में कार्य करता है। आप इसे संदर्भ और एक बहुविकल्पीय प्रश्न देते हैं, और यह विकल्पों पर एक संभाव्यता वितरण लौटाता है। नीचे दिए गए प्रयोगों की पूरी श्रृंखला की लागत $4.00 से कम थी।

मैंने Jev की कैलिब्रेशन का परीक्षण अच्छी तरह से समझे गए भौतिक वितरणों का उपयोग करके किया, जैसे Maxwell-Boltzmann वितरण। मैंने 10 उम्मीदवार वितरण, प्रति वितरण 5 प्रॉम्प्ट टेम्पलेट, और प्रति प्रॉम्प्ट 20 विविधताएँ चुनीं, जिससे कुल 1,000 सेटिंग्स बनीं। GPT-6 Astra और Claude Opus 5.5 का उपयोग प्रयोगों को लागू करने, टेम्पलेट प्रॉम्प्ट लिखने और API कॉल के लिए किया गया।

Jev Claude या GPT जैसे LLM से कैसे भिन्न है?

Jev एक System One क्लासिफायर मॉडल है जो पूर्व-प्रशिक्षित transformer लेता है और उसके अंत में क्लासिफायर जोड़ता है, जो कई विकल्पों पर संभाव्यता वितरण लौटाता है। इसके विपरीत, Claude या GPT जैसे LLM System Two मॉडल हैं जो स्टोकेस्टिक, ऑटोरेग्रेसिव हैं और मुक्त-पाठ आउटपुट देते हैं जो वर्गीकरण कार्यों के लिए उपयुक्त नहीं है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Seberapa akurat kalibrasi Jev?

Jev adalah model klasifikasi "System One" baru dari Type Safe. Nama ini terinspirasi dari buku Daniel Kahneman, Thinking, Fast and Slow, di mana ia membedakan antara pemikiran System One yang cepat dan naluriah dengan pemikiran System Two yang lebih lambat dan sadar. Model bahasa besar (LLM) seperti Claude atau GPT adalah model System Two, sedangkan "model keputusan" seperti Jev dan pendahulunya (misalnya Laya) adalah System One.

Jev mengambil transformer yang sudah dilatih dan menambahkan pengklasifikasi di ujungnya, memungkinkannya menggunakan konteks baru secara langsung sambil bertindak sebagai pengklasifikasi. Anda memberikan konteks dan pertanyaan pilihan ganda, dan ia mengembalikan distribusi probabilitas atas pilihan-pilihan tersebut. Seluruh rangkaian eksperimen di bawah ini menghabiskan biaya kurang dari $4.00.

Saya menguji kalibrasi Jev menggunakan distribusi fisik yang dipahami dengan baik, seperti distribusi Maxwell-Boltzmann. Saya memilih 10 distribusi kandidat, 5 templat prompt per distribusi, dan 20 variasi per prompt, menghasilkan total 1.000 pengaturan. GPT-6 Astra dan Claude Opus 5.5 digunakan untuk mengimplementasikan eksperimen, menulis templat prompt, dan panggilan API.

Bagaimana Jev berbeda dari LLM seperti Claude atau GPT?

Jev adalah model pengklasifikasi System One yang mengambil transformer yang sudah dilatih dan menambahkan pengklasifikasi di ujungnya, mengembalikan distribusi probabilitas atas beberapa pilihan. Sebaliknya, LLM seperti Claude atau GPT adalah model System Two yang stokastik, autoregresif, dan menghasilkan teks bebas yang tidak cocok untuk tugas klasifikasi.

Bahasa Indonesia version →


🇯🇵 日本語

Jev のキャリブレーション精度は?

Jev は Type Safe の新しい「System One」分類器モデルです。この名前は Daniel Kahneman の著書『Thinking, Fast and Slow』に触発されており、彼は速く直感的な System One 思考と、遅く意識的な System Two 思考を区別しています。Claude や GPT のような大規模言語モデル(LLM)は System Two モデルであり、Jev やその前身(例:Laya)のような「決定モデル」は System One です。

Jev は事前学習済みトランスフォーマーを取り、その末尾に分類器を追加することで、分類器として機能しながら新しいコンテキストを即座に使用できます。コンテキストと多肢選択問題を与えると、選択肢に対する確率分布を返します。以下の一連の実験の総コストは $4.00 未満でした。

私は Maxwell-Boltzmann 分布のようなよく理解された物理分布を使用して Jev のキャリブレーションをテストしました。10 個の候補分布、各分布につき 5 つのプロンプトテンプレート、各プロンプトにつき 20 のバリエーションを選び、合計 1,000 の設定になりました。GPT-6 Astra と Claude Opus 5.5 は、実験の実装、テンプレートプロンプトの作成、API 呼び出しに使用されました。

Jev は Claude や GPT のような LLM とどう違うのですか?

Jev は System One 分類器モデルで、事前学習済みトランスフォーマーを取り、末尾に分類器を追加し、複数の選択肢に対する確率分布を返します。対照的に、Claude や GPT のような LLM は System Two モデルであり、確率的で自己回帰的であり、分類タスクに適さない自由形式テキストを出力します。

日本語 version →


🇧🇷 Português

Quão bem calibrado está o Jev?

Jev é o novo modelo classificador "System One" da Type Safe. O nome é inspirado no livro de Daniel Kahneman, Thinking, Fast and Slow, no qual ele distingue entre o pensamento rápido e instintivo do Sistema Um e o pensamento mais lento e consciente do Sistema Dois. Modelos de linguagem grandes (LLMs) como Claude ou GPT são modelos do Sistema Dois, enquanto "modelos de decisão" como Jev e seus antecessores (por exemplo, Laya) são do Sistema Um.

Jev pega um transformer pré-treinado e adiciona um classificador no final, permitindo que ele use novo contexto imediatamente enquanto atua como classificador. Você dá contexto e uma pergunta de múltipla escolha, e ele retorna uma distribuição de probabilidade sobre as opções. Toda a série de experimentos abaixo custou menos de $4,00.

Testei a calibração do Jev usando distribuições físicas bem conhecidas, como a distribuição de Maxwell-Boltzmann. Escolhi 10 distribuições candidatas, 5 modelos de prompt por distribuição e 20 variações por prompt, totalizando 1.000 configurações. GPT-6 Astra e Claude Opus 5.5 foram usados para implementar os experimentos, escrever os modelos de prompts e chamadas de API.

Como o Jev difere de LLMs como Claude ou GPT?

Jev é um modelo classificador System One que pega um transformer pré-treinado e adiciona um classificador no final, retornando uma distribuição de probabilidade sobre múltiplas opções. Em contraste, LLMs como Claude ou GPT são modelos System Two que são estocásticos, autorregressivos e produzem texto livre não adequado para tarefas de classificação.

Português version →


🇷🇺 Русский

Насколько точно откалиброван Jev?

Jev — новая модель классификатора «System One» от Type Safe. Название вдохновлено книгой Дэниела Канемана «Думай медленно... решай быстро», в которой он различает быстрое, интуитивное мышление Системы Один и более медленное, осознанное мышление Системы Два. Большие языковые модели (LLM), такие как Claude или GPT, являются моделями Системы Два, а «модели решений», такие как Jev и его предшественники (например, Laya), — Системы Один.

Jev берет предварительно обученный трансформер и добавляет классификатор в конец, что позволяет ему немедленно использовать новый контекст, оставаясь классификатором. Вы даете ему контекст и вопрос с множественным выбором, а он возвращает распределение вероятностей по вариантам. Вся серия экспериментов стоила менее $4.00.

Я проверил калибровку Jev, используя хорошо известные физические распределения, такие как распределение Максвелла-Больцмана. Я выбрал 10 кандидатных распределений, 5 шаблонов промптов для каждого распределения и 20 вариаций для каждого промпта, что дает 1,000 настроек. GPT-6 Astra и Claude Opus 5.5 использовались для реализации экспериментов, написания шаблонных промптов и вызовов API.

Чем Jev отличается от LLM, таких как Claude или GPT?

Jev — это модель классификатора System One, которая берет предварительно обученный трансформер и добавляет классификатор в конец, возвращая распределение вероятностей по нескольким вариантам. В отличие от этого, LLM, такие как Claude или GPT, являются моделями System Two, которые являются стохастическими, авторегрессионными и выводят свободный текст, не подходящий для задач классификации.

Русский version →


🇨🇳 简体中文

Jev 的校准准确度如何?

Jev 是 Type Safe 的新型“System One”分类器模型。该名称灵感来源于 Daniel Kahneman 的著作《思考,快与慢》,他在书中区分了快速、直觉性的 System One 思维和较慢、有意识的 System Two 思维。像 Claude 或 GPT 这样的大型语言模型(LLM)属于 System Two 模型,而像 Jev 及其前身(例如 Laya)这样的“决策模型”属于 System One。

Jev 采用预训练的 transformer,并在其末端连接一个分类器,使其能够立即使用新上下文,同时充当分类器。你提供上下文和一个多项选择题,它会返回多个选项上的概率分布。以下整个系列实验的成本不到 $4.00。

我使用已知的物理分布(如 Maxwell-Boltzmann 分布)测试了 Jev 的校准。我选择了 10 个候选分布,每个分布 5 个提示模板,每个提示 20 个变体,总共 1,000 个设置。GPT-6 Astra 和 Claude Opus 5.5 用于实现实验、编写模板提示和 API 调用。

Jev 与 Claude 或 GPT 等 LLM 有何不同?

Jev 是一种 System One 分类器模型,采用预训练的 transformer,并在其末端连接分类器,返回多个选项上的概率分布。相比之下,Claude 或 GPT 等 LLM 是 System Two 模型,具有随机性、自回归性,输出自由文本,不适合分类任务。

简体中文 version →