Zürcher Nachrichten - L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent

EUR -
AED 4.216125
AFN 74.621719
ALL 91.702089
AMD 416.711307
ANG 2.055386
AOA 1052.739855
ARS 1733.529937
AUD 1.611486
AWG 2.069317
AZN 1.94802
BAM 1.955853
BBD 2.311953
BDT 140.963825
BGN 1.932634
BHD 0.43271
BIF 3453.378665
BMD 1.148026
BND 1.464633
BOB 11.679317
BRL 5.885123
BSD 1.147826
BTN 110.061986
BWP 15.566355
BYN 3.489479
BYR 22501.312563
BZD 2.308653
CAD 1.605302
CDF 2653.089103
CHF 0.946961
CLF 0.027903
CLP 1101.772158
CNY 7.700443
CNH 7.687671
COP 3638.014511
CRC 513.511697
CUC 1.148026
CUP 30.422693
CVE 110.267992
CZK 24.315711
DJF 204.404656
DKK 7.475481
DOP 67.991549
DZD 153.69284
EGP 59.843733
ERN 17.220392
ETB 187.497071
FJD 2.544489
FKP 0.853761
GBP 0.859166
GEL 2.990619
GGP 0.853761
GHS 13.212359
GIP 0.853761
GMD 84.368659
GNF 10073.9293
GTQ 8.758238
GYD 240.116515
HKD 9.006093
HNL 30.808702
HRK 7.535187
HTG 150.023417
HUF 362.498439
IDR 20371.724053
ILS 3.482979
IMP 0.853761
INR 109.926431
IQD 1503.734254
IRR 1578076.747429
ISK 139.405036
JEP 0.853761
JMD 181.144126
JOD 0.813942
JPY 180.034032
KES 148.841865
KGS 100.395388
KHR 4675.106495
KMF 491.355358
KPW 1033.223901
KRW 1589.413473
KWD 0.354165
KYD 0.956622
KZT 511.321648
LAK 25709.585645
LBP 102792.341533
LKR 380.718672
LRD 199.155404
LSL 18.699326
LTL 3.389823
LVL 0.694429
LYD 7.291166
MAD 10.933797
MDL 20.151459
MGA 4985.113557
MKD 61.526669
MMK 2410.470116
MNT 4129.27924
MOP 9.275911
MRU 45.984047
MUR 54.714996
MVR 17.737289
MWK 1990.445341
MXN 19.690933
MYR 4.683681
MZN 73.35324
NAD 18.699326
NGN 1528.126437
NIO 42.240962
NOK 10.811898
NPR 176.098011
NZD 2.00755
OMR 0.441414
PAB 1.147831
PEN 3.875205
PGK 5.107116
PHP 71.941631
PKR 318.162548
PLN 4.356506
PYG 6790.154675
QAR 4.184214
RON 5.261981
RSD 117.387978
RUB 97.016735
RWF 1693.738582
SAR 4.263076
SBD 9.184797
SCR 15.789434
SDG 690.527373
SEK 11.269088
SGD 1.464755
SHP 0.857536
SLE 28.287533
SLL 24073.525056
SOS 656.014944
SRD 43.333965
STD 23761.823474
STN 24.500558
SVC 10.044229
SYP 14926.63631
SZL 18.692426
THB 38.194523
TJS 10.589187
TMT 4.018092
TND 3.343624
TOP 2.764171
TRY 56.004889
TTD 7.793178
TWD 36.501605
TZS 3041.245294
UAH 51.294568
UGX 4511.122407
USD 1.148026
UYU 46.151252
UZS 13516.307891
VES 970.604392
VND 29853.272035
VUV 135.819625
WST 3.148936
XAF 655.957
XAG 0.017427
XAU 0.000264
XCD 3.102598
XCG 2.068747
XDR 0.811714
XOF 655.957
XPF 119.331742
YER 271.680336
ZAR 18.658806
ZMK 10333.615177
ZMW 22.527513
ZWL 369.663952
SSP 6495.73372
MXV 2.232544
  • AEX

    4.7100

    1100.8

    +0.43%

  • BEL20

    43.5800

    5777.27

    +0.76%

  • PX1

    46.4000

    8186.93

    +0.57%

  • ISEQ

    -14.3400

    14326.14

    -0.1%

  • OSEBX

    13.1600

    2136.55

    +0.62%

  • PSI20

    130.7000

    9671.11

    +1.37%

  • ENTEC

    -5.8300

    1416.23

    -0.41%

  • BIOTK

    111.0800

    4663.37

    +2.44%

  • N150

    24.3700

    4298.99

    +0.57%

L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent / Photo: HENRY NICHOLLS - AFP/Archives

L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent

Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.

Taille du texte:

Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.

Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.

Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.

o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).

Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.

Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.

"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."

Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.

Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.

Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).

Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.

Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.

- L'IA en justice? -

"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.

Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.

Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.

"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".

Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.

Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.

Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.

Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".

A.Weber--NZN