HeadlinesBriefing favicon HeadlinesBriefing.com

Riesgos en construcción de agentes: ¿Alineado con quién?

Hacker News •
×

Sobre el riesgo de seguridad, para aquellos de ustedes que están construyendo agentes: Debido a que son expertos en las preocupaciones X, Y y Z, su agente probablemente sea fenomenal en estas cosas y ustedes no corren riesgo en esos dominios. ¡Pero! hay innumerables otras preocupaciones que ustedes han especificado de manera deficiente o pobre, no tienen capacidad para juzgar la corrección por sí mismos y no pueden posiblemente evaluar el riesgo. Están dependiendo muy fuertemente de los priors del modelo para hacer un buen trabajo mitigando ese riesgo. Esto está extremadamente en el territorio de lo desconocido-desconocido tanto para ustedes como para el uso del modelo.

Para mí, es difícil tener una confianza muy, muy alta en los priors de los modelos porque soy un ingeniero de software experto y no estoy contento (y nunca lo he estado) con los comportamientos por defecto del modelo al producir software. Mi experiencia en escribir software me da una visibilidad inusualmente buena y me hace mucho menos dispuesto a confiar ciegamente en sus priors en contabilidad de doble entrada, finanzas, derecho, operaciones o cualquier otra cosa que no pueda evaluar personalmente a profundidad de experto.

Los ingenieros de software (¡y recientemente, matemáticos!) en este punto están muy familiarizados con la "basura" —salida del modelo que, aunque hace el trabajo, es mala de alguna manera. Cada uso de Record o manejo de excepciones excesivamente defensivo que los ingenieros de software hayan visto de los modelos es porque un no experto recompensó al modelo por estos comportamientos durante el entrenamiento. Los priors del modelo son malos.

Entidades clave: Personas: Karan Lyons, David Adrian, Bryan Berg