Back to Timeline
TO
Сегодня я узнал

Data distributor

Авиационные катастрофы за последние 55 лет: устойчивый нисходящий тренд по количеству жертв и инцидентов

Авиационный транспорт — самый безопасный из всех, и это не просто красивые слова. Анализ общедоступных данных показывает, что на протяжение многих десятилетий количество авиационных происшествий и погибающих в них людей устойчиво снижается несмотря на интенсивных рост частоты перевозок самолётами.

За последние 55 лет мировой пассажиропоток вырос кратно, примерно в 10 раз. Предсказуемый результат на фоне роста мирового населения в 2 с лишним раза и мирового ВВП в номинале в 20 с лишним раз. При этом за тот же период с 1970 г. количество инцидентов с гражданским авиатранспортом, которое могло привести или привело к жертвам, сократилось в 3 раза, с 331 до 109 в год. В те же три 3 раза сократилось количество погибших: с 2,219 в 1970 г.до 776 в 2025 г.

По данным Управления регистрации авиакатастроф (ACRO), общее число погибших в результате авиационных происшествий в мире с 1970 г. составило 83,772 человека. С 2005 г. лишь 7 раз число жертв превысило отметку в 1 тысячу. В 2023 г. был поставлен рекорд: лишь 246 погибших (против 2-3 тысяч в 1970-1990-х).

Data distributor в Telegram|в MAX|в ВК


Сиолошная

Если сделать грубую прикидку, то DeepSeek потратили на предтренировку DSv4 Pro примерно 10^25 FLOPs (оценка на основе количества токенов, написанных в статье, и количества активных параметров).

Для сравнения, уже появляются датацентры, где устанавливают по 100'000 видеокарт (например, у Elon Musk и xAI — правда карты предыдущего поколения, Hopper, а не Blackwell. Прямо как у DeepSeek). На таком объеме с утилизацией 22% (что ниже достижимого) 10^25 FLOPs можно выжать за...18 часов. То есть такую модель можно обучить ЗА СУТКИ😦. Китайцы там поди пару месяцев потели-высиживали тренировку.

Понятно, что нужно настроить инфраструктуру, подготовить данные, написать очень эффективную тренировку, но всё это так и так делается и будет делаться дальше. Плюс после предтренировки нужно ещё запускать SFT, RL, дистилляцию — заняться есть чем.

И всё же... the compute gap real.


Data Secrets

Китайский исследователь создал специальный бенчмарк, с помощью которого можно оценить количество параметров в любой модели

Как мы знаем, закрытые лаборатории не раскрывают количество параметров своих моделей. Есть стандартный метод оценки через экономику инференса, но он дает погрешность в 2× и более из-за неизвестных деталей об инфре.

Так вот: позавчера на архиве появилась статья, в которой автор предлагает принципиально иной подход, через оценку количества знаний модели. Речь именно о знании фактов, а не интеллекте в целом, потому что способность к рассуждению можно дистиллировать и сжимать в меньшие модели, а фактические знания – нет, они ограничены энтропией Шеннона.

Методология такая: автор создал бенчмарк из 1400 фактических вопросов, разбитых на 7 уровней редкости, от широко известных фактов до крайне малоизвестных. Его откалибровали на 89 открытых моделях с известным числом параметров, и оказалось, что есть явная (R²=0.917) лог-линейная зависимость скора на бенче от числа параметров.

Проецируя закрытые модели на калибровочную кривую, автор получает такие оценки*:

– GPT-5.5 ≈ 9.7T параметров
– Claude Opus 4.6 ≈ 5.3T
– Claude Sonnet 4.6 ≈ 1.7T
– Gemini 2.5 Pro ≈ 1.2T

• из-за природы метода и из-за настроек безопасности некоторых моделей (на какие-то вопросы они могут просто отказываться отвечать), эти оценки ближе к нижним границам.

Конечно, точность все равно довольно мала, но числа интересные.

https://arxiv.org/pdf/2604.24827


Сиолошная

Хорошо, что новый метод не даёт погрешность в 2 раза 😨

(если кроме шуток, то в статье есть и интересные тезисы — например, какие из моделей OpenAI были обновлением/тренировкой новой базовой модели, и в целом ранжирование моделей скорее ближе к правде, чем нет)