AI-платформа для discovery материалов в ВКР: от датасета до защищаемых метрик

Поддомен: AI/ML. Роль: Data/ML-инженер.

SES AI — производитель аккумуляторов из Массачусетса — свернул часть проектов для EV и переориентировался на AI materials discovery. Их платформа Molecular Universe уже нашла шесть новых электролитов, один из которых заменяет FEC без газовыделения при нагреве. CEO Qichao Hu прямо говорит: масштабировать производство ячеек на Западе нерентабельно, а находить материалы моделированием — дешевле и быстрее. Для выпускника ИТ здесь два сигнала. Первый: на защите выигрывают работы, где ML решает прикладную задачу, а не крутит MNIST. Второй: заказчики и комиссии всё чаще спрашивают про метрики экономии, а не только про accuracy. Разберём, как из этой новости сделать защищаемую ВКР.

FAQ: что чаще всего спрашивают про ML-discovery в дипломе

Где брать данные, если у меня нет лаборатории?

Открытые базы: Materials Project, OQMD, AFLOW, NOMAD. Они дают formation energy, band gap, плотность состояний для сотен тысяч соединений. Плюс литературные датасеты из статей по электролитам. В главе 1 описываете сбор и нормализацию: единицы измерения, дубликаты, расхождения DFT-функционалов. Это уже половина «аналитической» главы.

Как валидировать модель, если физический синтез недоступен?

Три уровня. Оффлайн-валидация на hold-out из тех же баз. Кросс-валидация по химическим семействам (не по случайным сплитам — иначе утечка). И сравнение предсказаний вашей модели с независимым DFT-расчётом или с литературными экспериментами хотя бы для топ-20 кандидатов. Это честно и защищаемо.

Как считать эффективность, если комиссия просит «экономический эффект»?

Считайте не рубли, а сэкономленные ресурсы: часы DFT-расчётов, стоимость CPU-часов в облаке, число лабораторных итераций. Формула простая: (N_full − N_screened) × cost_per_experiment. В статье SES именно этот аргумент: не делать ячейку физически, а находить материалы алгоритмически.

Какой стек выбрать для главы 2?

Python + RDKit (дескрипторы), PyTorch Geometric или DGL (графовые модели), scikit-learn для бейзлайнов, Optuna для байесовской оптимизации, MLflow + DVC для воспроизводимости. Деплой — FastAPI + Docker, при желании Kubernetes. Всё это легко показать на C4-диаграмме и защитить как инженерное решение.

Темы ВКР по мотивам кейса SES AI

Как встроить материал статьи в главы ВКР

Глава 1: анализ предметной области и постановка задачи

Разберите кейс SES AI как иллюстрацию перехода от hardware-бизнеса к software-plus-data. Покажите на цифрах: Hu говорит, что производить ячейки на Западе нерентабельно, а лицензирование платформы масштабируется без фабрик. Отсюда ваша постановка: ML-модель как средство снижения стоимости R&D. Обязательно упомяните скепсис Kara Rodby из Volta Energy Technologies — «новый материал сам по себе не разблокирует отрасль». Это даст вам контраргумент в выводах и покажет, что вы не просто пересказываете пресс-релиз, а анализируете.

Инструменты для этой главы: обзорные таблицы баз данных, схема таксономии методов (DFT, MD, GNN, трансформеры для молекул). Уместна диаграмма потока «гипотеза → симуляция → синтез → тест → обратная связь».

Глава 2: проектирование и реализация

Здесь главное — не утонуть в математике. Опишите пайплайн как инженерную систему: слои данных, признаки, модель, инференс API. C4-диаграмма (контекст + контейнеры) снимает половину вопросов на защите. Покажите, где хранятся артефакты (S3/MinIO), где версионируются данные (DVC), где логируются запуски (MLflow).

# упрощённый цикл active learning для скрининга электролитов
import optuna
from sklearn.gaussian_process import GaussianProcessRegressor
from sklearn.gaussian_process.kernels import RBF, WhiteKernel

def objective(trial):
    # гиперпараметры ядра GP
    length_scale = trial.suggest_float("length_scale", 0.1, 5.0)
    noise = trial.suggest_float("noise", 1e-5, 1e-1, log=True)
    kernel = RBF(length_scale) + WhiteKernel(noise)

    model = GaussianProcessRegressor(kernel=kernel, normalize_y=True)
    model.fit(X_labeled, y_labeled)

    # acquisition: expected improvement по пулу непомеченных кандидатов
    mu, sigma = model.predict(X_pool, return_std=True)
    ei = expected_improvement(mu, sigma, best_so_far=y_labeled.max())
    candidate_idx = ei.argmax()

    # в реальном пайплайне здесь запускается DFT-расчёт или синтез
    y_new = run_dft_or_experiment(X_pool[candidate_idx])

    X_labeled.append(X_pool[candidate_idx])
    y_labeled.append(y_new)
    trial.set_user_attr("hit", float(y_new > TARGET_THRESHOLD))
    return y_new

study = optuna.create_study(direction="maximize")
study.optimize(objective, n_trials=50)

Такой фрагмент закрывает вопрос «где тут ML-инженерия, а не просто ноутбук». Каждый вызов run_dft_or_experiment — это дорогая операция, а цель — сократить их число. Метрики цикла: кривая «лучший найденный материал vs. число итераций», hit rate в top-K, экономия вычислительных часов.

Глава 3: тестирование и оценка эффективности

Разделите метрики на три группы. Технические: MAE/RMSE для регрессии, ROC-AUC для классификации «стабилен/нестабилен», top-K recall. Инженерные: latency инференса, throughput, воспроизводимость запуска (одинаковый seed → одинаковый результат). Экономические: сэкономленные часы DFT, снижение числа лабораторных итераций, стоимость одного «найденного» кандидата.

Свяжите это с ISO/IEC 25010 — характеристики functional suitability, performance efficiency, maintainability. Комиссия любит, когда метрика привязана к стандарту, а не взята с потолка. Для веб-части (если есть API) добавьте проверки из OWASP API Security Top 10: аутентификация, rate limiting, валидация входных молекул в SMILES.

МетрикаЧто показываетКак считатьОриентир
MAE по band gapТочность регрессииmean(|y_pred − y_true|)< 0.3 эВ для GNN
Top-50 hit rateДоля перспективных кандидатов в выдачеДоля compounds с целевым свойством среди top-50> 30 %
Сэкономленные DFT-часыВыгода пайплайнаN_full − N_screened × часы на расчёт40–60 %
Время инференсаГотовность к prodp95 latency на батче из 1000 молекул< 2 с

Чему вы научитесь на такой работе

Чек-лист перед сдачей
  • Датасет описан: источник, лицензия, дата выгрузки, фильтры, число записей до и после очистки.
  • Сплиты обоснованы (по семействам, по времени, по источнику) — не random split без пояснений.
  • Каждая задача из введения отражена в конкретном разделе и в выводах.
  • Схемы: C4-контекст, C4-контейнеры, диаграмма пайплайна, UML классов для API.
  • Метрики посчитаны с доверительными интервалами или хотя бы с указанием разброса по фолдам.
  • Оформление по ГОСТ: подписи рисунков, таблиц, листингов; ссылки на источники в квадратных скобках.
  • Приложения: код, конфиги, полный список найденных кандидатов, инструкция по запуску.
Типичные ошибки студентов
  1. Пересказ статьи вместо анализа. Комиссия сразу видит компиляцию новостей. SES AI — это повод поставить задачу, а не содержание главы. Берите их проблемы (газообразование добавок, дороговизна DFT) как формализуемые цели.
  2. Метрики без интерпретации. MAE = 0.28 эВ ничего не значит, пока не сказано, что порог синтеза — 0.3 эВ, а бейзлайн давал 0.5 эВ. Всегда показывайте дельту к бейзлайну.
  3. Игнорирование скептиков. В статье Rodby сомневается, что discovery материалов спасёт отрасль. Если вы этого не упомянули, выводы выглядят однобоко. Введите раздел «ограничения подхода» — это плюс, а не минус.
Если тема кажется объёмной, а сроки поджимают — у нас есть 120 часов, чтобы разложить её по главам вместе с вами. Первая консультация бесплатная: разберём ваш датасет и подскажем, какие метрики зайдут комиссии. Помощь с дипломом — это в первую очередь про структуру и аргументы, а не про «сдать и забыть».

Материал подготовлен экспертами компании «Диплом-Про». Мы помогаем студентам с 2010 года: от выбора темы и постановки задачи до нормоконтроля и предзащиты. Если нужна поддержка в разработке ML-части, оформлении схем по ГОСТ или расчёте эффективности — наши специалисты подскажут, где узкие места.

Последнее обновление: 2026-09-19

Источник: Why this battery company is pivoting to AI (опубликовано 2026-03-25)