AI-платформа для discovery материалов в ВКР: от датасета до защищаемых метрик
Поддомен: AI/ML. Роль: Data/ML-инженер.
SES AI — производитель аккумуляторов из Массачусетса — свернул часть проектов для EV и переориентировался на AI materials discovery. Их платформа Molecular Universe уже нашла шесть новых электролитов, один из которых заменяет FEC без газовыделения при нагреве. CEO Qichao Hu прямо говорит: масштабировать производство ячеек на Западе нерентабельно, а находить материалы моделированием — дешевле и быстрее. Для выпускника ИТ здесь два сигнала. Первый: на защите выигрывают работы, где ML решает прикладную задачу, а не крутит MNIST. Второй: заказчики и комиссии всё чаще спрашивают про метрики экономии, а не только про accuracy. Разберём, как из этой новости сделать защищаемую ВКР.
FAQ: что чаще всего спрашивают про ML-discovery в дипломе
Где брать данные, если у меня нет лаборатории?
Открытые базы: Materials Project, OQMD, AFLOW, NOMAD. Они дают formation energy, band gap, плотность состояний для сотен тысяч соединений. Плюс литературные датасеты из статей по электролитам. В главе 1 описываете сбор и нормализацию: единицы измерения, дубликаты, расхождения DFT-функционалов. Это уже половина «аналитической» главы.
Как валидировать модель, если физический синтез недоступен?
Три уровня. Оффлайн-валидация на hold-out из тех же баз. Кросс-валидация по химическим семействам (не по случайным сплитам — иначе утечка). И сравнение предсказаний вашей модели с независимым DFT-расчётом или с литературными экспериментами хотя бы для топ-20 кандидатов. Это честно и защищаемо.
Как считать эффективность, если комиссия просит «экономический эффект»?
Считайте не рубли, а сэкономленные ресурсы: часы DFT-расчётов, стоимость CPU-часов в облаке, число лабораторных итераций. Формула простая: (N_full − N_screened) × cost_per_experiment. В статье SES именно этот аргумент: не делать ячейку физически, а находить материалы алгоритмически.
Какой стек выбрать для главы 2?
Python + RDKit (дескрипторы), PyTorch Geometric или DGL (графовые модели), scikit-learn для бейзлайнов, Optuna для байесовской оптимизации, MLflow + DVC для воспроизводимости. Деплой — FastAPI + Docker, при желании Kubernetes. Всё это легко показать на C4-диаграмме и защитить как инженерное решение.
Темы ВКР по мотивам кейса SES AI
-
Тема 1. Прогнозирование стабильности электролитов для литий-ионных ячеек методами графовых нейросетей.
Актуальность: SES AI ищет добавки, снижающие газообразование на кремниевых анодах — та же задача в открытых данных.
Цель: модель, предсказывающая HOMO/LUMO и энергию связи добавки с поверхностью анода.
Задачи: собрать датасет из Materials Project + литература; построить признаки молекул через RDKit; обучить GNN; сравнить с бейзлайном на случайном лесе; оценить MAE и top-K hit rate.
Структура: Гл.1 — обзор ML для материалов, Гл.2 — пайплайн и архитектура модели, Гл.3 — эксперименты и метрики. -
Тема 2. Платформа активного обучения для скрининга материалов с минимизацией DFT-расчётов.
Актуальность: в статье звучит мысль, что доменная экспертиза и данные важнее самой модели — это ровно про цикл active learning.
Цель: снизить число дорогих вычислительных итераций на 40–60 % при сохранении точности.
Задачи: реализовать байесовскую оптимизацию через Optuna; настроить acquisition function; логировать эксперименты в MLflow; построить кривые «точность / число итераций»; оценить экономию CPU-часов.
Структура: Гл.1 — теория active learning, Гл.2 — сервис на FastAPI + очередь задач, Гл.3 — бенчмарки и расчёт экономии. -
Тема 3. MLOps-контур для непрерывного обновления модели поиска материалов.
Актуальность: SES собирается лицензировать платформу другим производителям — значит, нужны версионирование данных, мониторинг дрейфа, автоматические ретраины.
Цель: воспроизводимый CI/CD для ML: DVC-пайплайн, реестр моделей, алерты на деградацию метрик.
Задачи: упаковать пайплайн в DVC; настроить MLflow Model Registry; ввести Data Drift Detection (Evidently/PSI); описать SLO для инференса; оформить по ГОСТ 34.601 стадии внедрения.
Структура: Гл.1 — MLOps-практики и ISO/IEC 25010, Гл.2 — архитектура контура (C4), Гл.3 — нагрузочные тесты и метрики надёжности.
Как встроить материал статьи в главы ВКР
Глава 1: анализ предметной области и постановка задачи
Разберите кейс SES AI как иллюстрацию перехода от hardware-бизнеса к software-plus-data. Покажите на цифрах: Hu говорит, что производить ячейки на Западе нерентабельно, а лицензирование платформы масштабируется без фабрик. Отсюда ваша постановка: ML-модель как средство снижения стоимости R&D. Обязательно упомяните скепсис Kara Rodby из Volta Energy Technologies — «новый материал сам по себе не разблокирует отрасль». Это даст вам контраргумент в выводах и покажет, что вы не просто пересказываете пресс-релиз, а анализируете.
Инструменты для этой главы: обзорные таблицы баз данных, схема таксономии методов (DFT, MD, GNN, трансформеры для молекул). Уместна диаграмма потока «гипотеза → симуляция → синтез → тест → обратная связь».
Глава 2: проектирование и реализация
Здесь главное — не утонуть в математике. Опишите пайплайн как инженерную систему: слои данных, признаки, модель, инференс API. C4-диаграмма (контекст + контейнеры) снимает половину вопросов на защите. Покажите, где хранятся артефакты (S3/MinIO), где версионируются данные (DVC), где логируются запуски (MLflow).
# упрощённый цикл active learning для скрининга электролитов
import optuna
from sklearn.gaussian_process import GaussianProcessRegressor
from sklearn.gaussian_process.kernels import RBF, WhiteKernel
def objective(trial):
# гиперпараметры ядра GP
length_scale = trial.suggest_float("length_scale", 0.1, 5.0)
noise = trial.suggest_float("noise", 1e-5, 1e-1, log=True)
kernel = RBF(length_scale) + WhiteKernel(noise)
model = GaussianProcessRegressor(kernel=kernel, normalize_y=True)
model.fit(X_labeled, y_labeled)
# acquisition: expected improvement по пулу непомеченных кандидатов
mu, sigma = model.predict(X_pool, return_std=True)
ei = expected_improvement(mu, sigma, best_so_far=y_labeled.max())
candidate_idx = ei.argmax()
# в реальном пайплайне здесь запускается DFT-расчёт или синтез
y_new = run_dft_or_experiment(X_pool[candidate_idx])
X_labeled.append(X_pool[candidate_idx])
y_labeled.append(y_new)
trial.set_user_attr("hit", float(y_new > TARGET_THRESHOLD))
return y_new
study = optuna.create_study(direction="maximize")
study.optimize(objective, n_trials=50)
Такой фрагмент закрывает вопрос «где тут ML-инженерия, а не просто ноутбук». Каждый вызов run_dft_or_experiment — это дорогая операция, а цель — сократить их число. Метрики цикла: кривая «лучший найденный материал vs. число итераций», hit rate в top-K, экономия вычислительных часов.
Глава 3: тестирование и оценка эффективности
Разделите метрики на три группы. Технические: MAE/RMSE для регрессии, ROC-AUC для классификации «стабилен/нестабилен», top-K recall. Инженерные: latency инференса, throughput, воспроизводимость запуска (одинаковый seed → одинаковый результат). Экономические: сэкономленные часы DFT, снижение числа лабораторных итераций, стоимость одного «найденного» кандидата.
Свяжите это с ISO/IEC 25010 — характеристики functional suitability, performance efficiency, maintainability. Комиссия любит, когда метрика привязана к стандарту, а не взята с потолка. Для веб-части (если есть API) добавьте проверки из OWASP API Security Top 10: аутентификация, rate limiting, валидация входных молекул в SMILES.
| Метрика | Что показывает | Как считать | Ориентир |
|---|---|---|---|
| MAE по band gap | Точность регрессии | mean(|y_pred − y_true|) | < 0.3 эВ для GNN |
| Top-50 hit rate | Доля перспективных кандидатов в выдаче | Доля compounds с целевым свойством среди top-50 | > 30 % |
| Сэкономленные DFT-часы | Выгода пайплайна | N_full − N_screened × часы на расчёт | 40–60 % |
| Время инференса | Готовность к prod | p95 latency на батче из 1000 молекул | < 2 с |
Чему вы научитесь на такой работе
- Проектировать ML-пайплайн с версионированием данных (DVC) и экспериментов (MLflow), а не «ноутбук на флешке».
- Валидировать модели на химически осмысленных сплитах, избегая утечки между train и test.
- Считать экономический эффект ML-решения через сэкономленные ресурсы — язык, понятный комиссии и бизнесу.
- Оформлять архитектуру по C4 и UML, стадии внедрения — по ГОСТ 34.601, качество — по ISO/IEC 25010.
- Защищать выбор модели через сравнение с бейзлайном, а не через «мы взяли трансформер, потому что модно».
- Датасет описан: источник, лицензия, дата выгрузки, фильтры, число записей до и после очистки.
- Сплиты обоснованы (по семействам, по времени, по источнику) — не random split без пояснений.
- Каждая задача из введения отражена в конкретном разделе и в выводах.
- Схемы: C4-контекст, C4-контейнеры, диаграмма пайплайна, UML классов для API.
- Метрики посчитаны с доверительными интервалами или хотя бы с указанием разброса по фолдам.
- Оформление по ГОСТ: подписи рисунков, таблиц, листингов; ссылки на источники в квадратных скобках.
- Приложения: код, конфиги, полный список найденных кандидатов, инструкция по запуску.
- Пересказ статьи вместо анализа. Комиссия сразу видит компиляцию новостей. SES AI — это повод поставить задачу, а не содержание главы. Берите их проблемы (газообразование добавок, дороговизна DFT) как формализуемые цели.
- Метрики без интерпретации. MAE = 0.28 эВ ничего не значит, пока не сказано, что порог синтеза — 0.3 эВ, а бейзлайн давал 0.5 эВ. Всегда показывайте дельту к бейзлайну.
- Игнорирование скептиков. В статье Rodby сомневается, что discovery материалов спасёт отрасль. Если вы этого не упомянули, выводы выглядят однобоко. Введите раздел «ограничения подхода» — это плюс, а не минус.
Источник: Why this battery company is pivoting to AI (опубликовано 2026-03-25)