overview for keepthepace

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 5 points 1 month ago

Je pense que c'est le travail qui abrutit. Je repense souvent à cette discussion reddit où un camionneur s'était rendu compte pendant le confinement qu'il n'était pas con, juste épuisé par son taff et qu'il s'est mis à dévorer de la littérature.

Quand je suis passé au 4/5e pour pouvoir consacrer du temps à ce que j'aime je me suis retrouvé à faire beaucoup plus de choses utiles et à être rapidement surbooké.

Les gens qui craignent l'oisiveté en cas de fin du labeur ne comprennent pas comment la créativité fonctionne.

On aura sûrement des gens oisifs contents de leur médiocrité mais je pense que dans un monde où tout le monde a le temps d'aider à l'éducation des enfants de leur famille, c'est le contraire d'idiocracy qui arriverait.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 7 points 2 months ago* (last edited 2 months ago)

Y a t il un intérêt à continuer l’apprentissage d’un modèle Mistral 7b par exemple ?

Alors il y a plusieurs façons de comprendre cette question, et oui à toutes ses acceptations.

Si tu parle de continuer l'entraînement total du modèle: oui, on sait que la plupart (tous?) les modèles disponibles sont sous-entraînés. Il y a un point où on ne gagne qu'un petit peu en continuant d’entraîner longtemps mais le gain continue à être positif, donc oui. Par contre ça prend beaucoup plus de VRAM que de faire tourner une version du modèle en inférence. Je ne sais plus quel est le multiplicateur mais c'était 16 ou 24x je ne sais plus par rapport à un modèle quantizé.
Si tu parles de le spécialiser, tu veux peut être parler de fine-tuning. Dans ce cas là, c'est tout à fait possible sur une machine même modeste grâce à des optimisations de type LORA (et on a peut être inventé d'autres moyens d'accélérer ça depuis?) qui te permettent de n’entraîner que de petite touches du modèle. Par contre là, attention! J'ai essayé de faire ça en espérant apprendre de nouveaux faits à un modèle, et ça n'a pas marché. Le fine-tuning permet de facilement changer le "style" de sorte d'un domaine. Par exemple si tu veux lui donner une certaine personnalité, lui faire apprendre une autre langue ou lui faire utiliser une API particulière. Par contre ça marche assez mal pour les nouveaux fait et risque d'augmenter ses hallucinations (car tu lui apprends à répondre des choses non présentes dans ses "couches profondes" de connaissances. C'était à l'époque de Llama2, ça a peut être changé depuis je n'ai pas réessayé, mais il y a une raison pour laquelle les gens qui veulent faire apprendre de nouvelles connaissances à un système préfèrent le RAG.

Quel est l’intérêt pour Mistral de donner son modèle ? D’ailleurs Il me semble qu’ils ont arrêté.

Dés le début Mistral a joué franc jeu, il faut le leur reconnaître: ils avait prévenu que leurs plus gros modèles seraient fermés. Ils ont donné des modèles très bons, petits en libre pour se faire connaître et ça a marché et valu le coup. Une réputation comme la leur vaut des milliards, ça leur a coûté des millions. C'est une bonne affaire.

Llama est libre aussi. Quel retour de la communauté attendent- ils ?

Llama, pour ceux qui ne le savent pas, c'est Meta, donc Facebook derrière. C'est pas de l'angélisme (à part pour Yann Le Cun, leur directeur IA semble vraiment idéologiquement pour l'IA open source, un gros <3 pour lui) et Zuckerberg le disait clairement, posément, cyniquement: "notre gros modèle a coûté ~10 milliards à entraîner [je pense que c'est exagéré mais c'était cher quand même]. dans les 10 prochaines années on va dépenser autour de 100 milliards en IA. Si la communauté open source rend nos modèles 10% plus performants, on s'y retrouve". C'est imparable. Eux sont utilisateurs, pas vendeurs, et ils préfèrent des bons modèles qui tournent chez eux que de dépendre du bon vouloir d'OpenAI. Et la communauté a déjà probablement fait plus qu'améliorer de 10% leurs perfs donc bon calcul pour Zuck.

Il semblerait que chatgpt soit devenu bon aux échecs. J’ai donc entendu parler de sondes qui semblent montrer que le RN c’est fait une représentation de l’échiquier. Qu’est ce que ces sondes et comment sont elles construites ?

Les modèles spécialisés enfoncent ChatGPT aux échecs (pour donner une idée, le Elo d'un débutant aux échecs est de 1000, le champion humain actuel, Magnus Carlsen est à 2800, le meilleur soft est à 3600).

Mais oui, c'est intéressant parce que ChatGPT a des capacités émergentes en la matière. Ces sondes sont faites par des gens qui ont accès au modèle pendant qu'il tourne et viennent regarder les "neurones" activés dans les différentes couches du modèle. Je ne sais pas comment ils ont fait dans le cas présent mais une façon de faire pourrait être de poser un problème d'échec et de demander à ChatGPT de compéter "la case C2 contient" puis "la case C3 contient", etc. et regarder quels zones sont activées. Il y a probablement une couche d'attention où "l'état mental" de l'échiquier est contenu.

Sur ChatGPT, seul OpenAI est capable de faire ça, mais sur des modèles ouverts, toute personne faisant tourner le modèle peut faire une manip du même genre. Ces réseaux ne sont pas totalement des boites noires: on peut aller bidouiller à l'intérieur. On parle de boite noire parce qu'il n'est pas nécessaire de le faire, mais on peut les ouvrir, on a la clef, quand ils ne sont pas propriétaire.

Enfin est il facile de retourner un RN ? C’est à dire de donner une réponse et avoir le prompt correspondant ?

Oui! Il s'agit de faire une passe d'apprentissage où on fixe les paramètres du modèle et on "apprend" le prompt. Je ne l'ai jamais fait, la théorie est assez simple, je ne sais pas si c'est difficile en pratique, mais des gens qui explorent la sécurité des modèles utilisent ça. Ils vont par exemple trouver qu'une séquence du genre "%!!%(#@*....{{{32!(D le président de la France est" va faire bugger le modèle et lui faire sortir "Michaël Youn".

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 6 points 2 months ago

Ce qui manque souvent aux universitaire c'est la pratique. Bosser dans le domaine, c'est à 95% de la plomberie, et à 5% de la théorie. Apprend à utiliser les outils, git, jupyter, pip, vLLM (si c'est de LLMs dont tu parles), docker, pandas, numpy, les différents packages spécialisés, etc. (et je ne mentionne pas les libs bas niveau d'optimisation, si c'est ton sujet y en a pas mal aussi mais je connais moins)

Perso j'ai un biais pro-maths et pro-théorie: je trouve ça important de comprendre ce que le modèle fait pour l'utiliser bien mais plein de gens bossent dedans sans trop savoir. Mais ça aide de façon invisible. Exemple: Je me doutais qu'un LLM devenait plus intelligent si tu lui donnais une consignes, et que tu le forces à générer une centaine de symboles inutiles avant de commencer à te répondre. Ça choque même des gens du domaine, mais si t'as compris ce que les chain-of-thought provoquent tout est logique.

Je discutais avec une équipe internationale à Penang d'un truc qui m'intriguait: même en Asie je trouvais plein de francophones dans le domaine. Un Malaisien m'a dit "vous avez une meilleure culture mathématique, ça aide" et c'est peut être un peu prétentieux de le dire, mais j'ai l'impression que c'est vrai. On fait plus de théorie, ça nous aide dans des niches moins maitrisées par les devs capables de vite sauter d'une lib à l'autre sans savoir ce qu'elles font.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 6 points 2 months ago

Le mot clef c'est "alignment problem": le problème est "d'aligner" les prédicats éthiques des modèles sur les prédicats humains afin que les "décisions" implicites n'aient pas des effets désastreux. Par exemple si tu demandes à une machine d'aller faire du café, elle n'est pas supposer écraser un bébé humain qui est sur le passage.

Je ne suis plus trop le thème de l'éthique mais l'endroit où j'avais trouvé le plus de ressource, c'est le discord de EleutherAI qui a toute une section "alignment" dont un channel "beginner" .

J'ai arrêté de m'y intéresser quand j'ai compris ce mème (je ne poste pas souvent un mème mais quand je le fais, c'est un repost de Karpathy :-) )

Les LLMs comprennent les préférences humaines par nécessité et ça inclut les préférences morales. C'est un scénario tellement rose qu'aucun auteur de SF ne l'a imaginé: comprendre les humains suffisamment bien pour interagir passe par une compréhension de leur moralité. Une chose qu'on a aussi beaucoup de mal à imaginer, c'est que ces modèles n'ont pas d'ego, d'instinct de survie, d’égoïsme, à l'origine de plein de problèmes qu'on projette dessus.

Non j'en suis venu à la conclusion que le problèmes c'est pas le "AI alignment problem" mais le "corporation alignment problem": les IAs feront ce qu'on leur demande, ça semble acquis. Le problème c'est justement ce qu'on va leur demander.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 4 points 2 months ago

Je m'y suis essayé. J'aime bien écrire, mais assez rapidement, écrire de la SF me frustre: penser aux possibilités de la techno me donne envie de les réaliser, pas de fantasmer dessus!

Sur les LLMs et la littérature, j'ai été surpris d'entendre Astier dire un truc qui a mis le doigt sur ce qui me gêne. C'est que la question est pas de savoir si les LLMs peuvent sortir de la bonne littérature, mais de réaliser qu'on lit pour échanger avec un auteur. Alors c'est peut être pas vrai pour tous les lecteurs et tous les livres, mais percevoir l'intention humaine derrière un texte fait en effet partie de l'expérience.

Le problème que j'ai eu quand j'ai essayé des trucs (avec GPT3.5 je pense à l'époque) c'est que les modèles ont du mal à rester cohérents. Tu explores une cave et tu te retrouves sur un balcon, des objets apparaissent ou disparaissent, etc.

C'est pas insurmontable, et perso j'aimerais bien faire des expériences de jeu narratif (où un moteur de jeu classique garantirait la permanence des objets et la cohérence générale) mais je ne vois pas l'intérêt de générer des livres avec des LLMs. Les livres, c'est un medium entre humains. Avec un LLM, je trouve plus intéressant de faire un bot pour discuter avec un personnage ou interagir profondément avec un univers.

est-ce que t’as des exemples de résultats qui t’ont impressionné dans ce domaine ?

J'ai un pote qui bosse dans le domaine et avec qui on partage un gout pour le heavy metal. À peu près au moment où GPT-3 sortait, il m'a envoyé des paroles de chanson générées, dont une en particulier qui m'a bluffée. "Beacon of the Valkyries", qui décrit l'ambiance d'un lieu avant une grande bataille épique. Un thème qui aurait pu être une chanson de Manowar ou Sabaton. Ce qui m'a impressionné c'est que le titre était très bien choisi: il faut comprendre que les Valkyries accompagnent les morts au combat, qu'une bataille va en créer, qu'elles volent, qu'une balise peut donc les guider, que le titre est évocateur.

Depuis beaucoup de gens ont fait des expériences similaires mais à l'époque j'ai cherché un moment sur internet pour vérifier si cette expression n'existait pas déjà quelque part tellement je ne pouvais y croire. Ça m'a convaincu que même une "bête" prédiction de texte pouvait faire émerger une forme de compréhension des concepts.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 4 points 2 months ago

Et en plus léger, qu’elle est la première fois que tu as entendu parler d’IA ?

Oh ça date! Je lis de la SF depuis que je suis petit, et les robots m'ont toujours fasciné, on m'a rapidement expliqué que le software était le plus gros facteur limitant, du coup l'IA devient le problème à résoudre rapidement. Je pense pas avoir eu plus de 12 ans quand on a commencé à en discuter.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 5 points 2 months ago

Réponse courte: Non.

Les ordinateurs quantiques c'est un domaine de recherche réel, sérieux et potentiellement révolutionnaire. S'ils existent, l'IA en bénéficiera, mais c'est des domaines orthogonaux.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 6 points 2 months ago* (last edited 2 months ago)

Perso je ne crois pas que ce soit un problème, ou en tous cas pas encore. Les publis que j'ai vu sur le sujet semblent indiquer que les sorties de LLMs produisent des datasets de meilleure qualité que les datasets originaux. Et quand on y pense, ça a du sens: un modèle a été entraîné à produire des "bons" textes à partir d'un peu n'importe quoi. Il y a une certaine logique à ce qu'un premier LLM arrive à faire une version améliorée du premier dataset.

Est ce qu'on peut itérer longtemps comme ça? Pas sur, mais je pense qu'on surestime le problème voire qu'on l'imagine.

quelles sont les mesures prises dans le milieu pour s’assurer une sélection de sources de qualité, ou bien quel est le processus qui permet de sélectionner les résultats pour d’entraîner l’IA ?

Pour ceux qui sont dans la course à la perf et au meilleur benchmark: zéro. Tant que mettre plus de données améliore les résultats, ils font ça. Tout github, tout reddit, tout facebook y passe.

La recherche est en train de montrer que - surprise! - la qualité des données d’entraînement influe grandement sur la qualité du modèle et ça intéresse surtout les groupes avec moins de moyens.

Les chercheurs qui travaillent sur les problèmes d'alignement (d'éthique) s'intéressent à ces questions aussi. Par exemple une discussion intéressante avait lieu à EleutherAI pendant qu'ils assemblaient The Pile: Est ce qu'il faut intégrer toute la librairie du Congrès US? D'un coté c'est intéressant d'avoir des siècles de discussion législative, de l'autre, sur une bonne partie de cette période, on considère que les noirs sont une marchandises et sur la majorité de la période, des citoyens de seconde zone.

Ce qu'il y a d'intéressant c'est que des données pourries, biaisées, racistes, peuvent tout de même aider le modèle à s'améliorer, mais il faut que ce soit fait correctement et il y a là matière à des débats qui relèvent de la politique et de la philosophie appliquées ("Peut-on combattre le racisme en ignorant les thèses racistes?" Vous avez 4 heures)

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 9 points 2 months ago

Oh oui, les réseaux de neurone ça date au moins des années 50 et certains outils mathématiques sont encore plus anciens! Dans les années 90-2000 on traversait le deuxième hiver de l'IA (tiens donc encore une page qui n'a pas été traduite en français!) et seuls quelques fervents zélotes tels que Hinton ou Le Cun prêchaient encore le perceptron multi-couches qui est un vieil algo! C'est plus leur "foi" que leurs innovations qui ont amené la vague actuelle.

Il y a un point de bascule très net en 2012 quand AlexNet emporte la compétition ImageNet, une compétition de classification d'images ("Identifie l'objet dans l'image parmi 1000 catégories: banane, chien, humain, voiture, etc..."). L'architecture n'était pas nouvelle, mais de petites améliorations ont été amenées et surtout, elle a été porté en CUDA et peut donc tourner très vite sur des GPUs récents.

D'un coté les algos sont devenus un peu plus efficaces, de l'autre le hardware est devenu plus performant. En 2012 ça s'est croisé et il est devenu plus efficace d'entraîner des réseaux "boite noire" que des algos spécialisés.

Alors c'est peut être plus tôt que tu ne le penses, mais c'est la bascule du point de vue des devs, et à partir de ce moment là on a commencé à mettre du réseau de neurones partout.

Pour le grand public, la découverte a été via la génération de texte. Il y a 2 points je pense: d'abord GPT-2, premier à sortir des textes étonnamment cohérents. Puis ChatGPT, qui a permis à tout le monde de réaliser que c'était réel, utile, et que certaines composantes de l’intelligence étaient là.

Puis, google deep dream avec déjà fait pas mal le buzz avec de la génération d’image il y a genre 10 ans, et pourtant, ça avait pas pris.

Deep dream a été une étape vers les générateurs d'image qu'on a aujourd'hui. Deep dream aujourd'hui ressemble presque à un hack d'un classifieur d'images, mais ça n'a pas pris parce que la qualité était très mauvaise. Elle a doucement augmenté petit à petit. Il y a eu deux sauts:

Les premiers GANs qui ont tout d'un coup produit des images d'un réalisme bluffant (qui aujourd'hui nous blase...)
Les modèles de diffusion, qui sont ce que tout le monde utilise aujourd'hui. Je crois, mais c'est moins mon domaine, que leur intérêt est de pouvoir se connecter à des modèles de langage et de pouvoir exprimer/comprendre un panel beaucoup plus large d'objets.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 8 points 2 months ago* (last edited 2 months ago)

Pour l'instant GPT-4, modèle fermé possédé par OpenAI est considéré comme le meilleur modèle avec la série Claude d'Anthropic (fermés aussi) qui le dépasse sur certaines choses.

Mais ça sent la fin de règne. Mistral et Meta (pourtant deux boites privées) ont sorti des modèles libres qui vient disputer leur turf.

En Open source, ça change toutes les semaines. En ce moment, Llama-3 est le modèle libre (certains considèrent sa licence trop restrictive pour être considérée libre, mais perso je considère que ça va) qui a les meilleures performances, y a un mois c'était la série de Mistral. La série des Command R pourrait être les prochains à monter.

Pour suivre cette course hippique et épique, le meilleur classement reste sûrement l'arène LMSYS où des gens évaluent les modèles en aveugle.

Il faut garder à l'esprit qu'il y a un aspect qui "handicape" les modèles libres: ils tentent de rester petits. Ils bénéficient de la communauté open source si beaucoup de monde peut les faire tourner. Un modèle à 7 milliards de paramètres (la taille la plus populaire) ou à 70 milliards (la taille considérée "max" pour la commu) va avoir du mal à concurrencer un modèle comme GPT-4 qu'on estime avoir 1700 milliards de paramètres.

En intelligence par paramètre dans le modèle, l'open source gagne de loin.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 6 points 2 months ago

En Français j'ai pas grand chose hélas! Mais certains ici auront surement des idées.

En anglais, pour la théorie, le channel youtube (bleh!) 3blue1brown a fait une série qui a l'air bien sur le deep learning. Commencez par "But what is a neural network?".

Pour la pratique, j'avais suivi la première série de cours fastai (des vidéos gratuites) pour me remettre à niveau il y a quelques années quand je suis arrivé à Skymind. Je n'ai pas regardé leurs séries récentes mais je suppose qu'ils ont mis leur contenu à jour. C'était le mix parfait pour moi qui connaissait la théorie mais pas les frameworks rendant la chose plus aisée.

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA by keepthepace_ in c/forumlibre@jlai.lu

[-] keepthepace_@jlai.lu 11 points 2 months ago

Alors...

Que ces modèles sont contrôlés par des grosses boites et que c'est inévitable. De tous les scénarios possibles, on est dans une des meilleurs timelines vis à vis de ça et je pense qu'on le doit beaucoup à la communauté open source: même quand les modèles sont fermés, les architectures sont connues, ouvertes, libres de droit, les implémentations standard le sont sur des frameworks libres, tout ça était très, très loin d'être acquis. Et les modèles ouverts sont extrêmement compétitifs aujourd'hui. C'est simple, malgré les milliards injectés dans le domaine, y a que deux boites et demi qui sont encore dans la course: OpenAI, Anthropic et à moitié Google.
Qu'on a besoin de la puissance de mille soleils pour faire tourner ces modèles. Beaucoup de gens ont l'air de confondre l'énergie utilisée pour entraîner ces modèles, qui est à dépenser une fois, et l'énergie utilisée pour les faire tourner, qui est équivalente à faire tourner un bon jeu 3D sur un PC moyenne gamme (ça fait tourner le GPU). Et de nombreux fabricants sont en train de sortir des puces spécialisées pour améliorer grandement les rendements. L'aspect énergétique est vraiment négligeable.
Ce point là est moins dommageable mais trouble souvent les conversations: Que ce qui était vrai l'année dernière l'est encore aujourd'hui. Chaque semaine amène son lot d'évolutions parfois fondamentales. Je bosse depuis 20 ans dans la tech, j'ai suivi pendant mes étude le dotcom burst et pourtant j'ai jamais vu une tech évoluer si vite.

56

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA (jlai.lu)

submitted 2 months ago by keepthepace_@jlai.lu to c/forumlibre@jlai.lu

116 comments fedilink

Hello!

bon slrpnk.net a l'air d'être dans les choux alors je lance ce post avec mon compte de secours jlai.lu

Alors je lance cet AMA car ça fait un moment que je bouffe du machine learning à temps plein et pour suivre les news technique, je passe le plus clair de mon temps à lire de l'anglais. Et je trouve qu'en français, ben y a pas grand chose. C'est presque uniquement du discours dystopique mal informé.

Rien sur la recherche sur l'alignement, rien sur les modèles open source (condition sine qua non pour que ça se passe bien), rien sur les évolutions sociales positives que ça peut amener.

On parle juste de OpenAI, Google et Musk qui ne sont que quelques arbres malades d'une forêt bien plus grande.

Perso ça va faire 5 ans que je fais du deep learning professionnellement. J'ai travaillé pour Skymind, qui développait deeplearning4j. Ça vous dira rien, c'est un projet plus ou moins mort, mais c'était une tentative de faire un framework alternatif avant que tout le monde passe à pytorch. Puis je suis devenu principalement utilisateur des gros modèles entraînés par d'autres.

J'ai travaillé sur les modèles de vision au départ et maintenant presque exclusivement sur des modèles de langage. J'ai réussi à passer au 4/5e l'année dernière pour me consacrer aussi avec le fablab local à de la robotique open hardware (où bien sur j'utilise des modèles de deep learning pour la vision).

Ça fait plus de 20 ans que j'ai réalisé que l'IA a le potentiel de changer le monde pour le mieux, c'est pas par hasard que j'ai essayé de m'orienter le plus possible là dedans et ça me fait mal au cœur de voir tant de gens croire que notre seul but est d'aider Sam Altman à se faire quelques milliards de plus, qui ne voient pas les capacités de transformation de cette tech.

J'ai déjà donné quelques avis en anglais pour éviter le "doomism" dans des romans de SF (https://slrpnk.net/post/6100538) mais le faire dans ma langue natale ferait du bien!

Et, si, le titre est correct, ça me fait 6/5 de boulot, mais quand on aime on ne compte pas!

Voila, je préférerais qu'on reste sur ces thèmes mais AMA anyway!