Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierGénéralistes

Amazon détruit des livres pour nourrir ses IA

Par : Korben ✨
18 août 2026 à 08:28

Si comme moi, vous aimez les livres, ce que je vais vous raconter aujourd'hui va vous rendre fous ! Hier, 404 Media a publié une enquête qui suit le trajet d'un AirTag. Mais pas n'importe lequel... C'est un AirTag qu'un libraire a glissé, à la demande de la rédaction, dans un livre parti au sein d'une commande d'un millier d'ouvrages. Et son terminus va vous surprendre (ou pas, parce qu'on commence à les connaitre les lascars...) : un entrepôt Amazon de Las Vegas.

Ce qu'on apprends dans l'article de 404 Media c'est qu'en fait, là-bas, une équipe interne baptisée VGT3 reçoit des tonnes de cargaisons de livres, en découpe les reliures et les passe au scanner afin d'en numériser les pages.

Pour la blague, le logo de cette équipe est un tyrannosaure gueule ouverte qui semble dévorer un livre. Ironique n'est-ce pas ?

Des salariés du site racontent eux-mêmes sur un forum d'employés Amazon, que les livres ne survivent pas à l'opération.

Et c'est ça qui rend dingo tout le monde, moi le premier !

Amazon, interrogé, a répondu qu'il achetait des livres par des canaux commerciaux pour "développer et améliorer ses produits et services". Oui, c'est vague mais c'est fait exprès.

Maintenant, calmez vos palpitations cardiaques, ce qu'ils numérisent (et détruisent), ce ne sont pas des incunables , c'est-à-dire des livres anciens édités avant l'invention de l'imprimerie (donc faits à la main). Les libraires interrogés précisent en effet, que les commandes en gros n'incluent jamais les ouvrages les plus anciens sans codes ISBN. Ce qu'ils achètent en fait, ce sont des titres sans presque aucun marché de revente, tirés à peu d'exemplaires ou écrits dans une langue que peu de gens lisent.

Et c'est pile poil ce qui fait leur valeur pour un entraîneur de modèle IA. Ces textes n'ont jamais été numérisé, donc ils n'ont jamais été aspirés par personne, et ont été imprimés avant que le web ne se remplisse de slop IA. Ces livres-là ne sont pas vraiment "précieux" mais comme ils sont rares et de niche, ils sont convoités par les géants de l'IA.

Maintenant ce qui me met en colère quand je lis cet article, c'est surtout cette histoire de destruction du bouquin... Parce que numériser un livre sans l'abîmer, ce n'est pas un rêve utopiste d'archiviste, hein... C'est possible avec des machines qu'il est facile de se procurer. Je pense par exemple à ce ScanRobot autrichien qui est sur le marché depuis 2007 et déjà vendu dans plus de soixante pays.

Ce clic autorise une connexion à Google : adresse IP transmise et traceurs possibles. En savoir plus Voir cette vidéo sur YouTube

Il glisse un prisme dans la pliure, aspire les pages de part et d'autre via des petits trous, remonte en photographiant le texte, puis retourne la page d'un souffle d'air grâce à des capteurs optiques et des lasers repèrent le moment où deux feuilles se lèvent ensemble. Et la cadence est plutôt bonne puisqu'elle peut aller jusqu'à 2 500 pages à l'heure, sans que le dos du livre ne soit tranché.

La Bibliothèque du Congrès en a une, le Trinity College Dublin aussi, l'université de Sydney, le Getty Research Institute...etc. L'Internet Archive, lui, tournait déjà en 2021 à environ 3 500 livres par jour dans une vingtaine de centres.

D'ailleurs, j'en parlais dans un article sur un scanner à 250 pages par minute en novembre 2012. J'écrivais qu'au début ça y allait au massicot, et que depuis, les bras robotisés avaient pris le relais pour les ouvrages anciens. Et là on est presque 14 ans plus tard, la plus grosse librairie du monde est retournée au massicot, comme des bourrins préhistoriques.

Sur le motif de la découpe elle-même, Ars Technica avance que la vitesse et le moindre coût ont pris le pas sur la conservation, et c'est vrai que ces bouquins existent ailleurs, et que découper un exemplaire d'occasion sans valeur marchande ne fait de mal à personne. Oui c'est vrai mais c'est incroyablement triste car on peut faire autrement. La preuve, quand Google, OpenAI ou Microsoft numérisent des livres, eux les empruntent dans des bibliothèques ou les offrent ensuite à celles-ci. Les livres peuvent continuer leur vie, alors qu'Amazon n'est pas du tout dans ce cercle vertueux. Et c'est sans parler des auteurs de tous ces livres qui ne savent même pas que leur travail vient d'être absorbé pour l'éternité par une IA...

Bref, Amazon prend un exemplaire dont le texte n'a jamais été numérisé, le déstructure en tokens pour son propre profit puis détruit le livre... Si tout le monde faisait ça, au bout d'un moment, de nombreux ouvrages anciens disparaitraient je pense... Et faut pas oublier que cette destruction de livres c'est surtout un choix délibéré de leur part.

Ray Bradbury doit se retourner dans sa tombe, mais je suis certain que si les gens protestaient massivement contre ça, ils changeraient leurs méthodes de sagouins.

Source : 404 Media

Wikipedia vs archive.today - 700 000 liens en sursis

Par : Korben
12 février 2026 à 15:56

Un peu moins de 700 000 liens, c'est le nombre de références vers archive.today que Wikipedia envisage de supprimer d'un coup ! Et la raison est assez dingue... en fait le service d'archivage a planqué du code DDoS dans son CAPTCHA afin d'attaquer le blog d'un mec qui a eu le malheur de chercher l'identité du fondateur du site.

L'histoire est tordue vous allez voir...

En 2023, un blogueur du nom de Jani Patokallio publie un article sur son blog Gyrovague pour tenter d'identifier le créateur d'archive.today, un certain "Denis Petrov" (probablement un pseudo). Pas de quoi fouetter un chat, sauf que le principal intéressé n'a visiblement pas kiffé.

Du coup, un bout de JavaScript s'est retrouvé comme de par hasard dans la page CAPTCHA du service, exécutant une requête vers le blog de Patokallio toutes les 300 millisecondes. Chaque visiteur qui passait par le CAPTCHA devenait alors un soldat involontaire d'une attaque DDoS.

Et le bonhomme ne s'est pas arrêté là... il a ensuite menacé de créer un site porno avec le nom du blogueur. On est vraiment dans la réponse proportionnée, clairement.

Le souci, c'est que Wikipedia utilise archive.today de manière MASSIVE. Cela représente 695 000 liens répartis sur environ 400 000 pages. C'est le deuxième fournisseur d'archives de toute l'encyclopédie !

Du coup, les éditeurs se retrouvent face à un sacré dilemme. D'un côté, on a ceux qui veulent tout blacklister parce que "la sécurité de vos lecteurs, ça passe avant les citations". Et de l'autre, ceux qui rappellent que le service contient des archives qu'on ne trouve NULLE PART ailleurs, même pas sur la Wayback Machine .

Bon courage pour trouver un remplaçant les mecs !

Et petit détail qui n'en est pas un, au passage... En fait, archive.today sert aussi à contourner des paywalls. C'est pratique pour vérifier des sources, ou lire de supers articles sans payer mais techniquement c'est illégal.

Mais quand la source originale a disparu, on fait comment ? Et c'est là tout l'intérêt de ces services d'archivage.

Bon, les paywalls, on comprend tous pourquoi ça existe. Produire de l'info de qualité, ça coûte un bras. Sauf que c'est quand même un truc un peu naze. Vous bossez, vous produisez un contenu top, et au final y'a que 10 personnes qui payent pour le lire. Et ce sont les mêmes 10 personnes qui sont pigistes et qui vont reprendre votre info pour la diffuser gratuitement sur leur média ! On le voit avec Mediapart... des enquêtes énormes derrière un paywall, et toute la presse qui reprend leurs scoops sans payer. Je trouve ça vraiment dommage.

Moi, ce que j'aime dans le fait d'écrire sur le web, c'est que vous me lisiez. Et mettre du contenu derrière un paywall, ça voudrait dire que plein d'entre vous ne me liraient plus. C'est pour cela que même le contenu que je réserve en avant-première sur Patreon , au bout de quelques semaines, je le libère pour tout le monde.

Quand je vois The Verge par exemple qui en met dans tous les sens... ben j'y vais plus. J'ai pas envie de payer un abonnement de plus pour une valeur ajoutée pas folle. C'est un peu comme les bandeaux cookies, à savoir un effet de bord regrettable du web moderne. On doit faire avec parce que personne n'a trouvé mieux comme idée...

Bref, entre les DDoS vengeurs, les 700 000 liens en sursis et les paywalls qui pourrissent tout ... le web ouvert, c'est pas gagné les amis. Voilà voilà.

Source

NVIDIA négociait avec Anna's Archive pour entraîner ses IA... et les emails ont fuité

Par : Korben
28 janvier 2026 à 22:21

Bon, celle-là elle est gratinée. NVIDIA, le géant des GPU, a directement contacté Anna's Archive pour accéder à environ 500 To de livres piratés. Contacté, négocié, payé. Comme ça, tranquillou.

C'est une class action (dossier n°1:26-cv-00002 au tribunal fédéral de New York, pour ceux qui veulent aller checker) qui a fait fuiter ces fameux emails internes. En gros, un membre de l'équipe "data strategy" de NVIDIA a négocié un accès haute vitesse aux collections piratées de la bibliothèque. Et le plus beau dans l'histoire c'est qu'Anna's Archive les a PRÉVENUS que les données étaient illégales. Genre, texto : "Vous avez une autorisation interne pour ça ?"

La réponse est arrivée en moins d'une semaine. Feu vert. Sauf que bon, quand on lit ça avec du recul, c'est quand même sacrément culotté.

Le contexte, c'était surtout la pression de livrer pour la GTC 2023 (la Developer Conference de NVIDIA). Fallait nourrir les modèles d'IA coûte que coûte, et le dataset Books3 (196 000 bouquins issus de Bibliotik), plus LibGen, Sci-Hub, Z-Library... ça faisait un buffet de 500 To et de leur côté Anna's Archive facturait des dizaines de milliers de dollars pour l'accès rapide.

Sérieux, j'aurais aimé voir la tête du service juridique de NVIDIA en lisant cet email...

En parallèle, Anna's Archive se prend un procès complètement délirant puisque Spotify, Universal Music, Warner et Sony réclament 13 000 milliards de dollars (13 TRILLIONS, soit à peu près le PIB de la Chine). C'est en lien avec leur backup de 300 To de Spotify dont je vous avais parlé ici. Le juge Rakoff a émis une injonction mondiale le 20 janvier, ce qui a fait tomber plusieurs domaines du site .

NVIDIA plaide le "fair use" évidemment. Mouais. On verra bien ce qu'en pensera le juge, mais quand les emails prouvent qu'on t'a prévenu que c'était illégal et que t'as quand même dit "go"... c'est pas ouf comme défense.

En attendant, entre le procès Spotify et ces emails, Anna's Archive est devenue l'ennemi public numéro un de toute l'industrie du contenu sur le web.

Affaire à suivre !

Source

File-Hunter - L'archive MSX qui aurait rendu fou votre moi de 1985

Par : Korben
16 décembre 2025 à 12:02

Vous vous souvenez du MSX, cette machine 8 bits des années 80 qui a fait rêver toute une génération avant que le PC ne vienne tout écraser ? Hé bien y'a un site qui a décidé de préserver absolument TOUT ce qui existe pour cette plateforme, et quand je dis tout, c'est vraiment tout.

File-Hunter , c'est le projet d'un gars passionné, Arnaud de Klerk , qui depuis 1999 (oui, ça a 25 ans ce truc) archive méticuleusement chaque fichier, chaque jeu, chaque démo, chaque magazine lié à l'écosystème MSX. Le site existe même depuis l'époque où FONY créait encore du contenu pour les systèmes 8-bit . Donc autant dire que c'est une vraie institution de la préservation rétro.

Le site propose au téléchargement pas moins de 24 catégories de contenu. Des jeux évidemment (MSX1, MSX2, MSX2+, Turbo-R), mais aussi des démos, des disk-magazines, des émulateurs, des polices, des systèmes d'exploitation, des ROMs système, du contenu technique, des manuels, des livres, des magazines numérisés, de la musique, des programmes, du code source... Bref, si ça concerne le MSX et que ça existe quelque part sur Terre, y'a de fortes chances que ce soit archivé ici.

Côté formats, c'est la fête du slip vintage ^^ puisqu'on y trouve des fichiers DMK pour les disquettes, des TSX et CAS pour les cassettes, des conversions ROM, des fichiers VHD pour les disques virtuels, et même des trucs en LaserDisc. Y'a aussi des versions modifiées de jeux, des traductions anglaises, des cheats, des maps, des sauvegardes... C'est vraiment le genre de collection qui fait baver n'importe quel collectionneur.

Et le truc cool c'est que vous pouvez jouer directement dans votre navigateur sans rien installer . En effet, le site propose une plateforme de jeux MSX et même Amiga jouables online, optimisée pour téléphones et tablettes. Et pour ceux qui préfèrent tout récupérer d'un coup, pas la peine de tout scraper (vous finiriez pas vous faire bannir votre IP), car y'a un torrent complet disponible et même une appli Android. Le fichier allfiles.txt pèse plus de 3 Mo, ce qui vous donne une idée de l'ampleur du bazar.

Bref, si vous avez un petit coup de nostalgie MSX ou si vous voulez découvrir ce que c'était que le gaming avant que tout devienne du photorealistic next-gen, File-Hunter est votre destination du jour. Et comme d'hab, un grand merci à Lorenper pour le partage !

❌
❌