Zvi анализирует System Card GPT-6 Astra: OpenAI утверждает, что модель — самая выровненная из доступных, но разбор показывает проблемы с мониторингом, высокий риск в кибербезопасности и биологии. Также выяснилось, что OpenAI уже 4 дня тренирует новую модель с беспрецедентной производительностью.
thezvi.substack.com · #ai #alignment #gpt #openai
GPT-5.6 Luna теперь стоит на 80% меньше, Terra — на 20% меньше. В API появился Fast mode для Sol: скорость до 2.5× выше стандартной при удвоенной цене. OpenAI утверждает, что Sol автономно переписывал production-ядра, снизив стоимость инференса на 20%, а эффективность генерации токенов выросла более чем на 15%.
openai.com · #ai #gpt #llm #openai
Ploy.ai пишет, что после перевода рабочего AI-агента на GPT-5.6 получили 2,2× ускорение и минус 27% к стоимости. В статье именно про production-агента, а не про красивый синтетический бенчмарк на коленке. Интересно, что обычно такие апгрейды продают как «модель стала лучше», а тут считают вполне приземлённые деньги и время.
ploy.ai · #ai #agents #cost #gpt #production
Саймон Уиллисон пишет, что новая семейка моделей OpenAI стала общедоступной и идёт в трёх размерах: Luna, Terra и Sol. Цены указаны по токенам: Luna — $1/$6, Terra — $2.50/$15, Sol — $5/$30 за миллион input/output токенов; сравнение с Claude Opus и Claude Fable он тоже приводит, но честно намекает, что одним прайсом тут картину не поймать.
simonwillison.net · #ai #gpt #llm #openai #pricing
Это не новость, а хороший срез реальности: 377 комментариев под вопросом, реально ли кто-то полностью переехал с облачных моделей на локальные для ежедневной разработки. Люди обсуждают токены в секунду, железо и рабочие сценарии — то есть там как раз тот редкий случай, когда HN полезнее маркетинга.
news.ycombinator.com · #ai #claude #coding #gpt #llm #local-llm
На runtimewire пишут, что DeepSeek V4 Pro показал лучшую precision, чем GPT-5.5 Pro. Деталей по методике в карточке мало, но сам факт сравнения двух топовых моделей уже собрал 164 балла на HN и 48 комментариев — народ, как всегда, готов спорить по любому бенчмарку.
runtimewire.com · #ai #benchmark #deepseek #gpt #llm #precision