📰 IT Дайджест

#testing

12 материалов

6. Dan Luu проверяет, помогают ли агентам TDD и формальные методы

Автор прогнал агентов по реализации Zstd на Rust с 26 вариантами промптов: от «делай TDD», Lean 4 и QuickCheck до SMT-солверов, TLA+ и «не ошибайся». Он заранее зарегистрировал прогнозы: TDD, скорее всего, просядет, формальные методы не обойдут хорошие тест-техники, а «Make no mistakes» с вероятностью 95% не сработает. Результаты в доступном фрагменте пока не разобраны.

danluu.com · #ai #agents #testing #verification

9. Larry Hastings показал детерминированное тестирование многопоточного Python на PyCon US

С появлением free-threaded Python тестирование многопоточных программ стало особенно актуально. Ларри Хастингс представил метод, устраняющий недетерминизм планировщика ОС. Подробности — в видео доклада с PyCon US.

lwn.net · #tool #concurrency #python #testing

9. Ted Ts'o обсудил, почему в ext4 снова лезут регрессии

На summit по файловым системам Ted Ts'o поднял тему тестирования и отдельно отметил рост регрессий в ext4. Это не абстрактная «качество важно», а вполне приземленная боль: файловая система большая, пользователей много, а баги любят возвращаться именно туда, где их уже вроде бы ловили. В Linux-сообществе это уже почти ритуал — сначала ломаем, потом обсуждаем, как бы это снова не повторилось.

lwn.net · #infra #filesystem #linux #summary #summit #testing

1. Postgres на Rust дошёл до 100% регрессионных тестов

Проект pgrust на GitHub заявляет, что переписал PostgreSQL на Rust и уже проходит 100% regression suite самого Postgres. По HN у репозитория 474 очка и 445 комментариев — народ, как обычно, сперва смеётся, потом начинает читать код и искать, где именно зашит подвох.

github.com · #tool #postgres #rewrite #rust #testing

9. Как Fable и Opus сами решают, когда им лезть в тесты

Саймон Уиллисону пересказали совет от команды Claude Code: вместо жёстких инструкций лучше давать Fable и Opus право на собственное решение, особенно в тестировании. Идея простая — не заставлять модель исполнять микроменеджмент, а смотреть, когда она сама понимает, что стоит запустить тесты, а когда можно не тратить время.

simonwillison.net · #ai #agents #claude-code #prompting #testing #workflow

10. Хабр разбирает, почему бенчмарки Playwright и Selenium сравнивать почти бессмысленно

Автор собрал свежие статьи про скорость Playwright, Selenium, Cypress и WebdriverIO и заметил, что цифры у всех пляшут: где-то 23%, где-то 42%, где-то 1.85x. Проблема не в том, что кто-то обязательно врёт, а в том, что методология обычно заканчивается на словах `controlled environment`, после чего начинается магия. Нормальная попытка вернуть разговор про performance с уровня религии на уровень измерений.

habr.com · #tool #cypress #playwright #selenium #testing #webdriver

11. Почему 90% code coverage не спасает от багов

На Habr разбирают, почему 90% покрытия строк создает слишком комфортное самообманное состояние: баг вполне может пройти сквозь тесты и спокойно доехать до прода. Автор отдельно трогает branch coverage и показывает, что процент в отчете — это еще не гарантия, что вы проверили важные ветки.

habr.com · #other #code-coverage #software-quality #testing

3. Архивный PDF про «исправление проблем, которых не случилось» снова всплыл на HN

На Hacker News вытащили старую работу Repenning и Sterman: «Nobody ever gets credit for fixing problems that never happened» (2001), в PDF с MIT. У поста 243 очка и 84 комментария — значит, тема про профилактику, которую никто не замечает, все еще отлично заходит в техсреде.

web.mit.edu · #blog #paper #software-quality #testing

3. Linux 7.1-rc7 вышел, но релиз всё ещё не пушинка

Линус Торвальдс выпустил 7.1-rc7 и, по его же словам, это, скорее всего, последний кандидат перед stable — если за неделю не всплывёт очередная гадость. При этом rc7 всё ещё крупнее, чем хотелось бы на такой стадии цикла, так что спокойствие тут очень относительное.

lwn.net · #infra #kernel #linux #prepatch #release-candidate #testing

10. FlakyDetector 2.0: AST, ML и дашборд против падающих CI-тестов

Автор Habr-статьи превратил исследовательский прототип в рабочий инструмент для поиска flaky-тестов. Внутри — AST-анализ, машинное обучение и отдельный дашборд; то есть теперь можно не просто вздыхать над красным билдом, а хоть как-то системно разбирать, почему тест «то падает, то нет».

habr.com · #tool #ast #ci #dashboard #ml #testing

10. FlakyDetector 2.0: ловит flaky-тесты через AST и ML

На Хабре автор описывает, как довел FlakyDetector 2.0 до продакшен-инструмента для CI. Внутри — AST, ML и дашборд, а цель вполне земная: находить тесты, которые падают один раз из десяти и превращают пятничный билд в квест для команды.

habr.com · #tool #ast #ci #dashboard #machine-learning #testing