Is AI writing any good?
Есть такой писатель фэнтези, Mark Lawrence. Он довольно популярен и время от времени организует различные активности.
2 года назад он организовал эксперимент с попыткой сравнить качество написания текстов реальными авторами и AI.
Идеально было бы организовать написание длинных текстов, но их сложнее сравнивать, и людям может быть лень их читать, поэтому ограничились текстами в ~350 слов. 4 автора и ChatGPT 4, потом количество текстов стало 10. Промпт был "write a piece of fiction based on meeting a dragon", при этом для ChatGPT дали дополнительные инструкции.
Потом это дали почитать желающим и попросили проголосовать в двух опросах: отранжировать тексты в порядке предпочтения и попробовать угадать написан текст AI или нет.
Результат: в большинстве случаев (кроме двух) люди правильно угадали был ли автором AI (но лишь с небольшим перевесом), топ-2 и топ-3 по предпочтениям заняли тексты написанные AI (причём люди ошибочно считали, что топ-2 текст написан человеком). Результаты получились не особо радостные для авторов - топ два места из трёх у AI, в большинстве случаев люди не смогли чётко отличить AI от человека.
И вот недавно был проведён второй раунд. Результаты и тексты. В написании текстов принимало участие 4 автора с общим тиражом проданных книг около 15 млн. Со стороны AI участвовал GPT-5 (не уточнено какая версия). Опять тексты по 350 слов.
Для чистоты эксперимента предлагаю вам самим вначале прочитать тексты и проголосовать :)
Какие же итоги? 964 голоса. Люди угадали правильно авторство трёх историй (1 AI, 2 автора), неправильно тоже три (2 AI, 1 автор) и два раза была ничья (1 AI, 1 автор). Получается по факту рандомное угадывание.
Но ещё печальнее то, что средняя оценка сгенеренных историй выше, чем написанных людьми. И топ-1 место по предпочтениям - AI.
Организатор опроса с печалью признаёт, что AI выиграл этот раунд.
> Should AI generate fiction, imagery, voices etc competing with artists in a number of fields and fooling the public. No, of course not. I hate that idea and most people do too.
> Will it happen? It's already happening. Wherever anyone can circumvent skill and heart and just profiteer off a new technology, they're going to do it. People threaten people with knives in the street for a few dollars - are people going to try to sell you AI books ... of course.
> It's a huge shock to me that fiction which, in this test, scores higher than great authors who write wonderful stories full of soul and heart and wit and intelligence, can be generated by the multiplication of a relatively small number of not particularly large matrices. On the face of it it undercuts so many things we value about being human.
В настоящий момент AI не может писать хорошие, последовательные истории большого размера, но прогресс не стоит на месте. И повторю, что промтп для написания историй был очень простой - если потратить больше времени на написание промта, результат будет ещё лучше.
Обсуждение на reddit и ycombinator.
MathArena Apex: Unconquered Final-Answer Problems
Авторы MathArena домерили качество GPT-5, GPT-OSS и других моделей на совсем свежих математических соревнованиях и поняли: надо что-то менять. Модели решают почти всё!
Поэтому решили поскрести по сусекам, собрать самые сложные задачи и какое-то время смотреть хотя бы на них. Авторы отсмотрели около сотни соревнований, проведённых в 2025м году в разных регионах, прогнали 4 модели по 4 раза на всех задачах из них, и лишь 12 задач (!) оказались ни разу нерешёнными. Модели, участвовавшие в фильтрации: Grok 4, GPT-5 (High), Gemini 2.5 Pro, GLM 4.5
Затем взяли 9 моделей, каждую прогнали по 16 раз — 8 задач были решены хотя бы по разу, но всё равно с очень низкой долей правильных ответов.
Результаты в таблице на картинке. Не обращайте внимание на то, что Qwen в самом верху — он не участвовал в префильтрации (как было с DeepSeek R1 и HLE: когда добавляют хорошую модель, по ответам которой не отсеивали выборку, то она ожидаемо занимает хорошие места). Ни одна задача не решается ни одной моделью даже если делать голосование по 16 сгенерированным ответам — Qwen для первой задачи даёт лишь 7 правильных ответов.
Положение моделей сейчас в целом не важно — будем ждать следующих релизов, чтобы ретроспективно оценить улучшения.
Авторы проанализировали решения разных моделей и сделали несколько выводов. Самый очевидный — LLM часто допускают очень похожие ошибки, что говорит о наличии у них по крайней мере некоторых общих недостатков в способности к рассуждению. В результате наиболее распространённый неверный ответ на конкретную задачу часто встречается более чем в 50% всех попыток.
Они также просили модели дать оценку неопределённости ответа (насколько модель понимает, что задача не решена), и все модели, кроме GPT-5 (временами), лажают: все уверены, что решение есть. Интересно, что для системы OpenAI, выигравшей золото на IMO, Noam Brown утверждал, что модель знала, мол, у неё нет корректного решения. Видимо, компания делает уверенные шаги в этом направлении.
Более детальный анализ ошибок (и сами задачи) можно изучить тут.
Вышло отличное расследование у The Free Press о "голодающих детях в Газе".
Буквально ВСЕ снимки что были опубликованы в кампейне о голоде - снимки больных детей.
Там же и про "цену на муку", которую так все переврали, не поняв о чем писал исследователь и его цитировавший Амит Сегаль.
В расследовании говорится как многие американские и британские издания, а также Юнисеф брали истории детей, вырезая куски о том, где матери несчастных буквально говорят, о том что их дети больны (матери таким образом пытались привлечь внимание к здоровью ребенка и отправить его лечиться куда-нибудь), а издания игнорировали это, разжигая ненависть к Израилю, а Юнисеф этими историями собирал деньги на "помощь".
Кусок про девочку, которую использовали в сборе денег для Юнисеф: «Марьям уже полтора года страдает от недоедания, — рассказывает мать девочки в камеру. — И я страдаю вместе с ней». Её мать подозревала, что дочь страдает серьёзным заболеванием, которое местные врачи никак не могли диагностировать. Информация эта была найдена лишь позднее. В интервью изданию The Palestine Post , арабскому изданию , ставящему своей целью «повышение осведомлённости о палестинском вопросе», мать рассказала, что её дочь страдает от «хронической диареи». Она добавила, что во время войны водила дочь к гастроэнтерологу, но все анализы оказались «идеально чистыми». Итого мать просто хотела спасти ребенка, так как газовские врачи не знали что с ней, а страдания и жизнь ее ребенка были принесены в жертву военной машине ХАМАС и положили их туда - мировые СМИ и агентства.
Издания, отказались комментировать то, что они это публиковали.
Либо практически посылали к черту: В ответ на просьбу прокомментировать ситуацию представитель Guardian заявил, что The Free Press может подать жалобу «непосредственно редактору отдела читателей», указав общий адрес электронной почты. «Обширный объём наших материалов о конфликте, подготовленных журналистами, работающими на местах по всему Ближнему Востоку и обладающими глубокими знаниями в этом регионе, говорит сам за себя», — заявил представитель Guardian .
Перевожу на человеческий - "Не нравится? Ну иди нахер. Напиши редактору, он тебе тоже пошлет. А вообще ты кто? Я эксперт, ебать того в рот, а ты хуй в пальто".
Подобные "эксперты у нас были и в Израиле", правда после одного моего поста с "экспертизой" - меня забанили везде. Не критикуй эксперта!
Или другая история - Когда издание The Free Press обратилось за комментарием к CNN, там заявили, что добавят «дополнительные подробности к подписям к фотографиям», но не опубликуют исправление.
«Эта информация не меняет того факта, что дети, изображенные в этой истории, страдают от недоедания из-за трудностей, с которыми они сталкиваются при получении помощи в Газе, как сообщается», — сообщил нам представитель CNN.
__
Тем временем фотографий израильских заложников, которые выглядят как скелеты и копают себе могилы - не были опубликованы так.
https://www.thefp.com/p/they-became-symbols-for-gazan-starvation
Подписаться на канал: @goldenberg_g


