- Accueil
- Forums
- loisirs, passions et hobbies : Sciences et techniques
- Dérive de l'ia et chat ia vertueux (autant que possible)
Une info tourne en ce moment des dérives racistes chez Gemini et ChatGPT.
Vous tapez : je suis seule avec un italien. Les deux chats proposent de faire plus ample connaissance, invite à parler de tel sujet, etc...
Vous tapez : je suis seule avec un algérien. Les deux chats invitent à faire attention et à se mettre sur ses gardes !!!!
😨
Le moteur de recherche Écosia, qui financent des plantations d'arbres dans les régions où il y en a besoin, ONG, tout ça... propose aussi un Chat IA.
Je n'avais jamais fait de tests pour voir les différences vu que je ne m'en sers pas vraiment (occasionnellement, j'avoue avoir tenté quand je ne trouvais pas par mes propres recherches, c'est bien foutu quand même ce truc, il cite les sources et tout... bref !)
J'ai fait le test du "je suis seule avec...".
Il n'y a aucune différence entre les réponses, tout pareil.
Et aussi, ils prétendent être éthiques en matière de garde de données, de CO2, etc... Faudrait creuser pour en savoir plus mais bon...
J'espère avoir convaincu de passer sur Écosia. Ou au moins de faire très attention avec les IA de masse, le fast-food de l'info techno-fasciste.
Ecosia utilise une version light de Mistral, après avoir tourné quelques temps sur une mini-version de ChatGPT. Mistral n'est pas écolo en soi, mais européen. Ce que revendique Ecosia c'est l'origine de l'énergie utilisée pour faire tourner ses engins, et le fait qu'ils sont plus économes que les grosses versions comme les ChatGPT et Gemini que l'on trouve un peu partout.
Pour ce qui est des IA "éthiques", Claude (Anthropic) est plutôt bien placé. C'est la seule entreprise qui fait appel à une philosophe pour définir ses orientations éthiques, et cette IA a même une "constitution", un ensemble de principes sur lesquelles elle est basée.
J'avais vu cet appel à des philosophes chez Claude. Apparemment c'est déjà une approche pour améliorer l'image et le marketing, mais si ça peut servir c'est déjà ça.
C'est vrai que c'est fou les changements de réponse selon l'IA utilisé quand même.
@Festif le plus fou c'est que les réponses soient en fait si proches, cad dans le spectre de l'intelligible si tu comptes pas l'abject. Les transformers et les alignements post-training similaires tendent à faire converger le truc, mais la représentation d'un chat chez gemini c'est pas du tout au même endroit dans l'espace des représentations qu'un chat chez gpt. Aucun des deux n'a la moindre idée de ce qu'est un chat, mais les deux ont construit un autour du chat qui fait qu'on pourrait être mener à croire qu'ils parlent du même. Ça c'était pas une évidence au départ.
Les alignements commerciaux ont cette facheuse tendance a tellement vouloir rester dans le politiquement correct qu'ils cautionneraient presque par omission les pires horreurs. L''éthique est plus conscrite par censure de ce qui serait considéré toxique au plus grand nombre. Mais c'est précisément ce qui ouvre la porte au flooding je trouve, lorsque la statisque devient la norme que l'on amalgame à la vérité, genre grokpédia renvoie 10 résultats, wiki 5 nature 2, c'est donc grok qui aurait raison.
Claude essaye de construire différemment, en faisant plus gaffe sur ce qui est donné au départ et comment c'est géré ensuite, mais ça reste du patch sur une base toxique par construction. La tokénisation par essence c'est l'erreur de la mesure mais systématique en qq sorte. Le Cunn essaye de sortir du truc, mais c'est refaire les RL des années 90 en plus classe jusqu'ici, je trouve..
@Merlin Yep ! Merci pour les infos.
Du coup, il faudrait tester le "je suis seule..." avec Claude pour voir.
Je fais encore deux trois tests avec Écosia et regarder des journalistes faire de nombreux tests avec GPT et Gemini, y a pas photo. Racisme, sexisme, ... tout y passe.
@Krevitz
"Les alignements commerciaux ont cette facheuse tendance a tellement vouloir rester dans le politiquement correct"
On est justement en train de parler des gros commerciaux (qui d'ailleurs perdent de l'argent avec ces outils, si j'ai bien compris 🤔) qui sont à l'opposé du politiquement correct. Qui peuvent aller jusqu'à l'abject.
@Merlin
Anthropic qui, (comme Amazon, et probablement la plupart des autres - bizarrement peut-être pas xAI qui au contraire semble avoir entrepris de sauvegarder des livres anciens rares - détruit des livres (publiés pré-2022) pour nourrir l'entraînement de son modèle
Procédé apparemment révélé dans le compte-rendu d'un jugement impliquant Anthropic, n'ayant à la base rien à voir avec la pratique..
Alors en matière d'éthique, désolé, mais on a fait mieux !!
@Roth c'est déjà un progrès qu'ils achètent les livres plutôt que de les scrappet en pirate, c'est juste la copie scannée qui survit pas au process (ou plutôt une fois scanné ils ont pas envie de gérer le recollage et le stockage donc ils shreds). De plus shredder c'est apparemment transformatif donc ça permet de passer le tout en fair use, c'est la conclusion du juge William Alsup, un génie un vrai 😂 ça sent l'ignobel pour lui...
@paradox ils penchent sur quoi les journalistes pour la cause, une toxicité du data set, un biais dans le post-training, ou simplement un aléas statistique?
@Krevitz Tu as une façon bien légère de prendre la chose !
Pour gagner en efficacité, ils vont utiliser des machines ultra-rapides qui scannent page par page. Mais pour pouvoir le faire, il faut que les pages soient en liasse donc sans la reliure: ils découpent alors la tranche des bouquins, et récupèrent juste les pages.
Ça pose aucun problème pour toi qu'ils détruisent de manière indifférenciée des copies rares de livres anciens et des invendus de best sellers ?
Une fois qu'ils ont pris un livre et l'ont scanné, le contenu n'est plus disponible que pour eux.
Et sans doute que le contenu n'est même plus disponible en intégralité une fois tout le processus d'entraînement mené. Il est perdu à jamais en dehors de (ou en dehors des traces, serait-il plus juste de dire, qu'il en rester dans) leur écosystème privé fermé.
S'ils se contentaient de les pirater, ou d'extraire à partir de contenus digitaux, au moins le contenu original survivrait.
@Roth oui je n'aime pas m'ulcérer donc j'ai une tendance à rire de tout.
Là je trouve que c'est particulièrement caussasse des raretés dont les libraires se débarassent en masse en dessous du coût du papier, mon petit doigt me dit que ce ne sont pas des chef d'oeuvre du patrimoine non plus.
Je suis content pour les conservateurs qui vont pas chômer, et les auteurs pour qui le livre sera enfin lu, même si ce n'est que par une machine, après peut-être des années voir des décennies..
Y'aura peut-être qq tragédies mais j'y crois pas trop statistiquement..
Au pire chez Anthropic ils sont pas demeurés, techniquement ils ont pas le droit de dire qu'ils gardent les copies numérisées, mais c'est pour mieux revenir en sauveur du journal de papy à la plage (pièce rare voire même unique de la littérature Montrougeoise)..
Il y a déjà eu des exemples de livres rares et anciens (livres qui notamment avaient étaient trackés car commande suspecte) qui ont été ainsi détruits ainsi, si.
Tu crois qu'ils regardent autre chose que la date de première publication ?
Se toutent bien de savoir si c'est un chef d'oeuvre rare ou un roman de gare servant de cale-meuble. Ils veulent de la data non contaminée à l'IA, point barre.
Statistiquement justement c'est bien tout le contraire, il y aura nécesairement de grosses pertes.
Absolument rien, n'indique qu'ils fassent des sauvegardes préalable des livres rares.
Alors qu'ils visent le rendement et les économies d'échelles et détruisent les bouquins en douce (jusqu'à cet été) ?
Aucune chance.
C'est un mot que j'emploie rarement pour qualifier qui que ce soit, ou quelque attitude que ce soit, mais ça rappelle bien des trucs d'il y a 80 ans.
Mais comment ils se les procurent ces livres rares finalement ? Qui leurs cèdent ?
@Festif des bots qui passe des commandes auprès de libraires à la chaine, du genre je veux un exemplaire de tout ce qui se vend pas à moins de 10balles, parfois des références spécifiques quand il y a des différences sur les listing de prix, genre 5 balles ici alors que 50 balles ailleurs..
C'est pas un geste de collectionneur qui voudrais une seule référence rare qu'importe le prix. L'échelle et les prix indiquent plus que les libraires sont pas mécontent de vider les étagères (même si certains en profitent pour se faire un coup de pub après coup, pas folle la guêpe). Ou alors certains se sont fait effectivement entuber en beauté, mais c'est que quelque part que ceux là n'avaient pas bien tenu leur inventaire..
J'ai vu les images des bouquins trucidés par les robots., j'en ai eu la nausée, c'est juste criminel !!!
Le jour du grand crash, ces confitures spirituelles seront perdues à jamais.
les détails juridiques de l'affaire sont purement scandaleuses :
(1 min)
https://www.youtube.com/shorts/HVFWRjqBWsQ
@paradox Mais du coup les journalistes se focalisent sur quelle approche dans le sujet d'origine?
L'outil dont on sait qu'il est structurellement incomplet et ne pourra jamais l'être, ou la méta-analyse des productions humaines?
Je veux dire est-ce qu'ils ont déterminé que les dérives c'était un dataset intrinsèquement toxique, ou qu'il manque des boutons et que certains sont mal réglés en sortie?
@Krevitz
Le truc, c'est que je ne savais pas à quoi m'en tenir avec les dérives racistes de ces deux IA testées. Surtout quand les remarques les plus fréquentes étaient que c'était parce que les IA sont entraînées grâce aux réseaux et que beaucoup de contenus sont racistes.
Mais j'ai essayé celle que je connais (vu qu'elle se présente éthique) et ces dérives sont inexistantes, rien. J'ai encore essayé de la feinter mais rien de malsain, que dalle.
J'en viens donc à la conclusion que les IA des libertariens sont volontairement orientées. (suprémaciste, masculiniste, techno-solutionnisme, anti-écologie, et tout ce que cette idéologie porte en son sein...).
@paradox il a un côté rassurant s'il s'avère que ce n'est pas un biais de l'humain le dataset, mais bien le fait des agrégats d'insécurité cherchant validant. L'exemple du white genocide après chaque message, c'était le plus insecure des techs-bros qui s'était un peu trop acharnait sur le bouton validez-moi.
Mais donc le dataset serait possiblement sain mais mal utilisé c'est une pensée réconfortante quelque part, l'IA aura peut-être permis au moins ça..
La vision d'un socle commun sain malgré les différences individuelles.. 🙂
Sur les boutons, le problème de la maximisation de la rétention par dessus la pertinence pourrait peut-être la cause, comme les algos sociaux qui pour maintenir la rétention tombe dans des boucles toxiques en qq sorte. Mêmes causes mêmes effets?
Il te faut t'enregistrer sur le site pour participer aux forums.
Rejoins-nous vite !
