HeadlinesBriefing favicon HeadlinesBriefing.com

Riscos na construção de agentes: Alinhado a quem?

Hacker News •
×

Sobre risco de segurança, para aqueles de vocês que estão construindo agentes: Como vocês são especialistas nas preocupações X, Y e Z, seu agente provavelmente será fenomenal nessas coisas e vocês não correm risco nesses domínios. Mas! Existem inúmeras outras preocupações que vocês especificaram de forma deficiente ou pobre, não têm capacidade de julgar a correção por si mesmos e não podem possivelmente avaliar o risco. Vocês estão dependendo muito fortemente dos priors do modelo para fazer um bom trabalho mitigando esse risco. Isso está extremamente no território do desconhecido-desconhecido tanto para vocês quanto para o uso do modelo.

Para mim, é difícil ter confiança muito, muito alta nos priors dos modelos porque sou um engenheiro de software especialista e não estou feliz (e nunca estive) com os comportamentos padrão do modelo ao produzir software. Minha experiência em escrever software me dá uma visibilidade incomumente boa e me torna muito menos disposto a confiar cegamente em seus priors em contabilidade de partida dobrada, finanças, direito, operações ou qualquer outra coisa que eu não possa avaliar pessoalmente em profundidade de especialista.

Engenheiros de software (e recentemente, matemáticos!) neste ponto estão muito familiarizados com "lixo" — saída do modelo que, embora faça o trabalho, é ruim de alguma forma. Cada uso de Record ou tratamento de exceção excessivamente defensivo que engenheiros de software já viram dos modelos é porque um não-especialista recompensou o modelo por esses comportamentos durante o treinamento. Os priors do modelo são ruins.

Entidades-chave: Pessoas: Karan Lyons, David Adrian, Bryan Berg