ИИ-сервис ускорения разработки катализаторов в дипломе: от анализа до реализации

В начале 2026 года учёные Университета Иннополис заявили о создании полностью отечественного программного комплекса на базе ИИ, который ускоряет разработку катализаторов для нефтегазовой и водородной энергетики в 5 раз. Для студента технической специальности это не просто новость — это готовая рамка для сильной ВКР. Кейс даёт свежий материал для аналитики, проектирования ML-системы и оценки экономического эффекта. В этой статье разбираем, как превратить сюжет из статьи в полноценный диплом: какие темы брать, как выстроить главы, какие метрики и стандарты использовать, и какие ошибки чаще всего губят работу на защите.

Основная часть: переносим кейс в структуру ВКР

Статья о ИИ-сервисе для катализаторов — не просто прецедент, а источник для формирования целей, задач и практической части дипломной работы. В зависимости от специальности и уровня (бакалавр/магистр) её можно встроить в три разных типа работ: аналитическую, проектную или исследовательскую. Ниже — три конкретные темы ВКР с актуальностью, целями, задачами и структурой по главам.

Темы ВКР на основе кейса Иннополиса

Тема ВКР Актуальность (отсылка к статье) Цель Задачи Структура
1. Разработка ИИ-сервиса для прогнозирования активности катализаторов (на примере гидроочистки) ИИ-сервис Иннополиса показал пятикратное ускорение, значит, рыночная потребность в таких системах подтверждена; можно взять более узкую задачу. Спроектировать и реализовать прототип ИИ-сервиса, предсказывающего ключевую характеристику катализатора (например, конверсию сырья). Анализ предметной области и сбор открытых данных; выбор ML-модели (градиентный бустинг, нейросеть); разработка REST API; оценка точности и сравнение с экспертной оценкой. Гл. 1 — анализ каталитических процессов и существующих ИИ-решений; Гл. 2 — проектирование и программная реализация; Гл. 3 — тестирование, метрики, расчёт ускорения.
2. Оптимизация пайплайна данных для обучения моделей машинного обучения в материаловедении Создание полностью отечественного ПО означает значимость импортонезависимых решений; пайплайны данных — критическая часть ML-системы. Разработать конвейер предобработки и валидации данных о катализаторах для повышения точности модели. Исследовать источники данных; построить ETL-процесс (Python + Pandas); реализовать автоматическую очистку (выбросы, пропуски); провести эксперименты по влиянию фичей на метрики. Гл. 1 — обзор способов хранения и обработки хим. данных; Гл. 2 — проектирование пайплайна; Гл. 3 — результаты экспериментов и сравнение метрик до/после оптимизации.
3. Проектирование архитектуры отечественного ИИ-сервиса для моделирования катализаторов Иннополис подчёркивает полную отечественность комплекса. В дипломе можно спроектировать аналог с обоснованием выбора стека и архитектурного стиля. Создать архитектурный проект распределённого ИИ-сервиса с учётом требований ГОСТ 34.602 и ISO/IEC 25010. Сформировать функциональные и нефункциональные требования; описать компоненты (модуль данных, ML-ядро, API-шлюз); построить диаграммы C4/UML; рассчитать нагрузку и отказоустойчивость. Гл. 1 — анализ аналогов и стандарты архитектуры ПО; Гл. 2 — проектирование (диаграммы C4, UML, ERD); Гл. 3 — прототип, нагрузочное тестирование, оценка качеств по ISO/IEC 25010.

Как видно, в каждой теме мы опираемся на факт из статьи — ускорение в 5 раз и полностью отечественная разработка. Это делает работу привязанной к реальности, а не «модели ради модели».

Как встроить кейс в главы 1–3: советы практика

Для любой темы обязательна первая глава — аналитическая. Здесь важно раскрыть физико-химические основы: почему катализаторы важны для нефтегаза, как их подбор выглядел до ИИ, какие точки торможения несёт ручной подбор. Подкрепите это цифрами из статьи: 5-кратное ускорение — ваша отправная точка. Далее опишите существующие решения: Gaussian Process, нейросети, коммерческий софт и, конечно, разработку Иннополиса.

Во второй главе — проектирование. Если вы делаете ML-сервис, обязательно добавьте схему пайплайна в нотации C4 (Context, Container, Component). Например:

+------------------+    +------------------+    +------------------+
|  Пользователь    | -> |   API Gateway    | -> |  ML Engine       |
|  (химик)         |    |  (FastAPI)       |    |  (PyTorch)       |
+------------------+    +------------------+    +------------------+
                                                      |
                                                      v
                                          +------------------+
                                          | Feature Store    |
                                          |  (ClickHouse)    |
                                          +------------------+

Отразите в тексте, почему выбран именно такой стек, как обрабатываются данные по катализаторам, какие модели сравниваются. Для защиты обязательно покажите early-example: обучение модели на открытом наборе данных (например, из каталитической базы NREL) и расчёт метрик.

В третьей главе — оценка эффективности. Здесь недостаточно просто вывести R². По аналогии со статьёй нужно посчитать временной эффект: на сколько процентов сокращается срок подбора катализатора по сравнению с ручным методом. Замерьте время обучения, инференса, доли автоматизированных шагов. Оформите это таблицей:

МетрикаБазовый вариант (ручной подбор)ИИ-сервисПрирост
Среднее время поиска кандидата, дней50105× (как в статье)
Число испытанных композиций12030−75%
Точность прогноза (R²)—0.87—

В приложении размещайте листинги кода, скриншоты интерфейса и полностью оформленное ТЗ по ГОСТ 34.602-2020.

Пример: минимальный код для ML-эксперимента

Чтобы показать комиссии «живость» работы, включите во вторую главу небольшой пайплайн обучения модели на синтетических или реальных данных. Например:

# Скрипт быстрой проверки гипотезы предсказания активности катализатора
import pandas as pd
from sklearn.ensemble import GradientBoostingRegressor
from sklearn.metrics import mean_absolute_error, r2_score

# X — признаки: состав, температура, давление; y — наблюдаемая активность
df = pd.read_csv('catalysts.csv')
X = df[['Ni_percent', 'Mo_percent', 'temp_C', 'pressure_atm']]
y = df['conversion']  # целевая переменная

model = GradientBoostingRegressor(n_estimators=200, max_depth=5)
model.fit(X, y)

pred = model.predict(X)
print(f'MAE: {mean_absolute_error(y, pred):.3f}')
print(f'R²: {r2_score(y, pred):.3f}')

# Сохраняем модель для REST-API
import joblib
joblib.dump(model, 'model_catalyst.joblib')

Этот фрагмент — отличная иллюстрация, но не забывайте про разделение train/test и кросс-валидацию в реальной работе.

Практические выводы: чему вы научитесь

Работа над такой ВКР даёт студенту не только отметку о защите, но и вполне реальные навыки, которые пригодятся на работе:

FAQ: частые вопросы студентов

1. Какую тему выбрать, если я учусь на бизнес-информатике, а не на Data Science?

Тема №3 из таблицы — «Проектирование архитектуры ИИ-сервиса» — подойдёт идеально, если сделать упор на технико-экономическое обоснование, анализ требований и оценку рисков. Можно добавить PMBOK 7 для описания жизненного цикла проекта.

2. Где взять данные о катализаторах, если это закрытая область?

Используйте открытые датасеты: Catalysis-Hub, NREL, материалы из OpenCatalyst. Если их мало — допустимо сгенерировать синтетические данные на основе физико-химических закономерностей и явно оговорить это в работе.

3. Как правильно оформить схемы в ВКР, чтобы не придрался нормоконтроль?

Для диаграмм используйте нотацию UML и C4. Каждая схема должна иметь номер, подпись и описание в тексте. Если вуз требует определенный ГОСТ на документы, сверяйтесь с методичкой, но универсальные стандарты — ГОСТ 34.601-90 (информационные технологии).

4. Какие метрики считаются хорошими для доказательства эффективности ИИ-решения?

Для катализаторов важны регрессионные метрики: MAE, RMSE, R², а также бизнес-метрика — ускорение в X раз. Покажите сравнение с базовым регрессором и с ручным методом подбора. Метрика «в точности как у Иннополиса» не обязательна, важно обосновать свой результат.

Чек-лист: что проверить перед сдачей

Проверьте:
☐ Все задачи из введения соответствуют выводам в заключении.
☐ Ссылка на статью Иннополиса корректно оформлена в списке источников.
☐ Диаграммы C4/UML подписаны и связаны с text-описанием.
☐ Код в приложении работает и содержит комментарии на русском.
☐ Метрики рассчитаны по честным данным, есть вывод об ускорении.
☐ Оформление соответствует ГОСТ 34.602 (для ТЗ) и ГОСТ 7.32 (для отчёта).
☐ Уникальность текста не ниже порога вуза (обычно 70–75%).

Типичные ошибки студентов

  • Игнорирование предобработки данных. Многие сразу пишут модель, забывая, что данные о катализаторах содержат пропуски, выбросы и физически невозможные сочетания. Из-за этого R² получается низким, и работа выглядит неубедительно. Решение — описать процесс очистки и доказать его необходимость.
  • Нет формального описания требований. Если проектируете сервис, вы обязаны выделить функциональные и нефункциональные требования (по ГОСТ 34.602). Без этого комиссия справедливо скажет, что система «висит в воздухе».
  • Сравнение метрик «в вакууме». Нельзя просто написать «R²=0.87, всё отлично». Нужно сравнить с базовыми моделями и с ручным подбором, как это сделали авторы статьи из Иннополиса. Иначе непонятно, в чём ваша заслуга.

Мягкий CTA

Если вы чувствуете, что завязли в теме — данных мало, архитектура не складывается, а сроки поджимают, — обращайтесь за консультацией. Мы помогаем студентам с 2010 года: бесплатно разбираем структуру ВКР, подсказываем, какие источники использовать, и можем взять на себя часть работы, если вы совсем «на плаву». 120 часов — среднее время, которое мы экономим студенту на согласовании методологии и отрисовке схем.

Эксперт

Материал подготовлен экспертами компании «Научные работы 24». Мы помогаем студентам с 2010 года. Если вам нужна помощь в разработке темы или оформлении работы, наши специалисты готовы подсказать даже по сложным междисциплинарным проектам — от ML-моделей до нефтегазового программного обеспечения.

Последнее обновление: 2026-08-12

Источник: В России создали ИИ-сервис, который ускоряет разработку катализаторов для нефтегаза и водородной энергетики в 5 раз (опубликовано 2026-03-18)