Zürcher Nachrichten - IA aprende a mentir, manipular e ameaçar seus criadores

EUR -
AED 4.211192
AFN 74.534894
ALL 91.798294
AMD 418.583419
ANG 2.052982
AOA 1051.508635
ARS 1734.686313
AUD 1.61298
AWG 2.06403
AZN 1.9526
BAM 1.95619
BBD 2.324263
BDT 142.088317
BGN 1.930374
BHD 0.435087
BIF 3451.587861
BMD 1.146684
BND 1.469493
BOB 12.688529
BRL 5.908976
BSD 1.15403
BTN 110.738069
BWP 15.652119
BYN 3.504498
BYR 22474.997001
BZD 2.320963
CAD 1.604761
CDF 2648.838265
CHF 0.945767
CLF 0.027702
CLP 1093.84416
CNY 7.690122
CNH 7.690783
COP 3593.924023
CRC 516.202873
CUC 1.146684
CUP 30.387113
CVE 110.286979
CZK 24.326834
DJF 205.500954
DKK 7.475132
DOP 68.123576
DZD 153.519917
EGP 59.858023
ERN 17.200253
ETB 188.498165
FJD 2.569431
FKP 0.852762
GBP 0.856842
GEL 2.98718
GGP 0.852762
GHS 13.253641
GIP 0.852762
GMD 84.854456
GNF 10147.022181
GTQ 8.809756
GYD 241.438116
HKD 8.996082
HNL 30.973173
HRK 7.534514
HTG 150.830059
HUF 364.99048
IDR 20354.779172
ILS 3.486142
IMP 0.852762
INR 109.959209
IQD 1511.801284
IRR 1576202.500407
ISK 139.803249
JEP 0.852762
JMD 182.116294
JOD 0.813022
JPY 178.606852
KES 149.045502
KGS 100.277358
KHR 4672.93126
KMF 490.780837
KPW 1032.015533
KRW 1586.488226
KWD 0.354061
KYD 0.961692
KZT 513.142263
LAK 25832.007893
LBP 103332.632108
LKR 382.464534
LRD 200.219901
LSL 18.786488
LTL 3.385858
LVL 0.693617
LYD 7.329461
MAD 10.882269
MDL 20.118343
MGA 4989.994447
MKD 61.537264
MMK 2407.651041
MNT 4124.449997
MOP 9.324758
MRU 46.206208
MUR 54.650852
MVR 17.670513
MWK 2001.098795
MXN 19.762248
MYR 4.697937
MZN 73.304886
NAD 18.788044
NGN 1525.960921
NIO 42.468463
NOK 10.806425
NPR 177.18131
NZD 2.000826
OMR 0.4409
PAB 1.15403
PEN 3.871672
PGK 5.21804
PHP 71.954853
PKR 319.861345
PLN 4.363635
PYG 6828.360812
QAR 4.195236
RON 5.263736
RSD 117.372257
RUB 96.606803
RWF 1702.739336
SAR 4.244305
SBD 9.174055
SCR 15.903892
SDG 689.732465
SEK 11.282193
SGD 1.463151
SHP 0.856533
SLE 28.254038
SLL 24045.370772
SOS 659.531437
SRD 43.290166
STD 23734.033729
STN 24.504884
SVC 10.098012
SYP 14909.179425
SZL 18.785744
THB 38.252789
TJS 10.645722
TMT 4.013392
TND 3.378573
TOP 2.760939
TRY 55.814717
TTD 7.824559
TWD 36.571523
TZS 3045.508853
UAH 51.464956
UGX 4517.900364
USD 1.146684
UYU 46.42905
UZS 13605.711457
VES 969.469258
VND 29808.611456
VUV 135.660782
WST 3.145254
XAF 655.957
XAG 0.017967
XAU 0.000266
XCD 3.098969
XCG 2.079814
XDR 0.810765
XOF 655.957
XPF 119.331742
YER 271.362267
ZAR 18.723823
ZMK 10321.524262
ZMW 22.647513
ZWL 369.231626
SSP 6488.13688
MXV 2.240628
IA aprende a mentir, manipular e ameaçar seus criadores
IA aprende a mentir, manipular e ameaçar seus criadores / foto: HENRY NICHOLLS - AFP

IA aprende a mentir, manipular e ameaçar seus criadores

Os últimos modelos de inteligência artificial (IA) generativa não se conformam mais em cumprir ordens. Começam a mentir, manipular e ameaçar para alcançar seus objetivos, diante dos olhares preocupados dos pesquisadores.

Tamanho do texto:

Ameaçado em ser desconectado, Claude 4, recém-criado pela Anthropic, chantageou um engenheiro e ameaçou revelar uma relação extraconjugal.

Por sua vez, o o1, da OpenAI, tentou se baixar em servidores externos e quando flagrado, negou.

Não é preciso se aprofundar na literatura ou no cinema: a IA que emula o comportamento humano já é uma realidade.

Para Simon Goldstein, professor da Universidade de Hong Kong, a razão para estas reações é o surgimento recente dos chamados modelos de "raciocínio", capazes de trabalhar por etapas em vez de produzir uma resposta instantânea.

O o1, versão inicial deste tipo da OpenAI, lançada em dezembro, "foi o primeiro que se comportou desta maneira", explica Marius Hobbhahn, encarregado da Apollo Research, que põe à prova grandes programas de IA generativa (LLM).

Estes programas também tendem, às vezes, a simular um "alinhamento", ou seja, dão a impressão de que seguem as instruções de um programador, quando na verdade buscam outros objetivos.

Por enquanto, estes traços se manifestam quando os algoritmos são submetidos a cenários extremos por humanos, mas "a questão é se os modelos cada vez mais potentes tenderão a ser honestos ou não", afirma Michael Chen, do organismo de avaliação METR.

"Os usuários também pressionam os modelos o tempo todo", diz Hobbhahn. "O que estamos vendo é um fenômeno real. Não estamos inventando nada".

Muitos internautas falam nas redes sociais de "um modelo que mente para eles ou inventa coisas. E não se tratam de alucinações, mas de duplicidade estratégica", insiste o cofundador da Apollo Research.

Embora Anthropic e OpenAI recorram a empresas externas, como a Apollo, para estudar seus programas, "uma maior transparência e um acesso maior" da comunidade científica "permitiriam investigar melhor para compreender e prevenir a farsa", sugere Chen, do METR.

Outro obstáculo: a comunidade acadêmica e as organizações sem fins lucrativos "dispõem de infinitamente menos recursos informáticos que os atores da IA", o que torna "impossível" examinar grandes modelos, assinala Mantas Mazeika, do Centro para a Segurança da Inteligência Artificial (CAIS).

As regulamentações atuais não estão desenhadas para enfrentar estes novos problemas.

Na União Europeia, a legislação se centra principalmente em como os humanos usam os modelos de IA, não em prevenir que os modelos se comportem mal.

Nos Estados Unidos, o governo de Donald Trump não quer nem ouvir falar em regulamentação, e o Congresso americano poderia, inclusive, proibir em breve que os estados regulem a IA.

- A IA no banco dos réus? -

"Por enquanto há muito pouca conscientização", diz Simon Goldstein, que, no entanto, avalia que o tema passará ao primeiro plano nos próximos meses com a revolução dos agentes de IA, interfaces capazes de realizar sozinhas uma multiplicidade de tarefas.

Os engenheiros estão em uma corrida atrás da IA e suas aberrações, com resultado duvidoso, em um contexto de forte concorrência.

A Anthropic pretende ser mais virtuosa que suas concorrentes, "mas está tentando idealizar um novo modelo para superar a OpenAI", segundo Goldstein. O ritmo dá pouco tempo para comprovações e correções.

"Como estão as coisas, as capacidades [da IA] estão se desenvolvendo mais rápido que a compreensão e a segurança", admite Hobbhahn, "mas ainda estamos em condições de nos atualizarmos".

Alguns apontam na direção da interpretabilidade, ciência que consiste em decifrar, do lado de dentro, como funciona um modelo de IA generativa, embora muitos, como o diretor do Centro para a Segurança da IA (CAIS), Dan Hendrycks, se mostrem céticos.

As trapaças da IA "poderiam obstaculizar a adoção caso se multipliquem, o que supõe um forte incentivo para que as empresas [do setor] resolvam" este problema, afirma Mazeika.

Goldstein, por sua vez, menciona o recurso aos tribunais para enquadrar a IA, dirigindo-se às empresas caso se desviem do caminho. Mas ele vai além, ao propor que os agentes da IA sejam "legalmente responsabilizados" em caso "de acidente ou delito".

O.Krasniqi--NZN