Генеративный ИИ в дипломе: как превратить тренд Google Photos в защищаемый ВКР по ML
Google запустил AI Enhance — инструмент в Google Photos, который с помощью генеративного ИИ автоматически обрезает, пересвечивает и улучшает фото. По данным ZDNet (2026), функция уже доступна на Android, но даёт сбои: иногда искажает пропорции, «перегорает» свет или создаёт неестественные текстуры. Это не баг — это возможность. Для студента технической специальности такие кейсы — золотая жила: они сочетают современные технологии, реальные ограничения и измеримые метрики. Особенно если вы пишете ВКР в области машинного обучения или обработки изображений. В этой статье покажу, как превратить публикацию про Google Photos в стройную, защищаемую работу, соответствующую и требованиям вуза, и реалиям индустрии.
Темы ВКР: как интегрировать AI Enhance в диплом
| Тема | Актуальность | Цель | Задачи | Структура ВКР |
|---|---|---|---|---|
| Оценка качества восстановления изображений с помощью генеративных моделей | Google AI Enhance демонстрирует типичные проблемы: артефакты, over-smoothing, неправильная сегментация. Это подтверждает необходимость объективных метрик качества. | Разработать методику оценки качества ИИ-аугментации изображений на основе гибридных метрик (PSNR, SSIM, LPIPS, экспертная оценка). |
1. Проанализировать архитектуры генеративных моделей (GAN, Diffusion). 2. Собрать датасет «до/после» (включая случаи сбоев, как в Google). 3. Протестировать модели на реальных данных. 4. Сравнить автоматические и субъективные метрики. |
Гл. 1: Анализ генеративных моделей и метрик качества. Гл. 2: Проектирование pipeline оценки. Гл. 3: Тестирование и интерпретация результатов. |
| Разработка локального аналога AI Enhance с контролем пропорций и освещения | Google работает в облаке, но пользователи теряют контроль. Локальное решение — плюс в ИБ и приватности. | Создать desktop-приложение с ИИ-аугментацией, сохраняющим геометрию и естественность света. |
1. Выбрать модель (Stable Diffusion Inpainting, ESRGAN). 2. Реализовать UI с ручными корректировками. 3. Добавить контрольные точки (face alignment, exposure histogram). 4. Протестировать на разнообразных сценах. |
Гл. 1: Обзор решений для ретуши и генерации. Гл. 2: Архитектура и реализация. Гл. 3: Юзабилити-тесты и метрики эффективности. |
| Анализ уязвимостей генеративных моделей в обработке фото: фейки, байесовские атаки, смещение | AI Enhance может искажать реальность. Это риски: от фейков до дискриминации по цвету кожи (как в старых версиях FaceApp). | Оценить этические и безопасные риски ИИ-аугментации на примере публичных кейсов. |
1. Проанализировать инциденты (включая Google). 2. Построить модель угроз (на базе OWASP для ML). 3. Разработать контрмеры (атрибуция, watermarking). 4. Протестировать на синтетических данных. |
Гл. 1: Этические и ИБ аспекты ИИ. Гл. 2: Моделирование угроз и проектирование защиты. Гл. 3: Оценка эффективности контрмер. |
Как вписать кейс Google в структуру ВКР
Глава 1: Теоретический анализ — не просто обзор, а фреймворк
Не ограничивайтесь пересказом статьи. Используйте её как кейс-триггер. Например:
- Начните с факта: «Google AI Enhance иногда обрезает важные части лица — это указывает на слабую привязку к facial landmarks».
- Перейдите к теории: сравните архитектуры StyleGAN3, Stable Diffusion и Deep Image Prior — где у кого больше рисков по геометрии?
- Вставьте диаграмму C4 уровня контейнеров: как может выглядеть pipeline от загрузки фото до вывода результата (с выделением модуля генерации, оценки качества, UI).
Используйте ISO/IEC 25010 как основу для оценки качества ПО: применимость здесь — «функциональная пригодность», «целостность данных», «удобство использования».
Глава 2: Проектирование — от схемы к коду
Покажите, как вы решаете проблему, которую Google не решил. Например, если выбрали тему локального редактора:
# Пример: контроль освещения через гистограмму
import cv2
import numpy as np
def adjust_exposure_balance(img, target_mean=128):
hsv = cv2.cvtColor(img, cv2.COLOR_BGR2HSV)
h, s, v = cv2.split(hsv)
# Коррекция яркости с учётом пересветов
v_mean = np.mean(v)
if abs(v_mean - target_mean) > 30:
scale = target_mean / v_mean
v = np.clip(v * scale, 0, 255).astype(np.uint8)
merged = cv2.merge([h, s, v])
return cv2.cvtColor(merged, cv2.COLOR_HSV2BGR)
# Используется ДО подачи на ИИ-модель — как препроцессинг
Добавьте UML-диаграмму последовательности: как пользователь загружает фото → система проверяет экспозицию → предлагает корректировку → применяет ИИ-аугментацию.
Глава 3: Тестирование — метрики, а не мнения
Не пишите «модель работает хорошо». Измеряйте:
- PSNR — пиковое отношение сигнал/шум (для потерь деталей).
- SSIM — структурное сходство (для восприятия человеком).
- LPIPS (Learned Perceptual Image Patch Similarity) — нейросетевая метрика, ближе к человеческому зрению.
- Время обработки — критично для UX.
- Субъективная оценка — опрос 10+ пользователей по шкале от 1 до 5.
Сравните ваше решение с Google AI Enhance на тех же изображениях. Это — ваш главный козырь на защите.
Чему вы научитесь
- Проектировать pipeline обработки изображений с контролем качества.
- Использовать метрики PSNR, SSIM, LPIPS для оценки ИИ-генерации.
- Строить UML/C4-диаграммы для ML-систем.
- Оформлять ТЗ и технические решения по ГОСТ 34.19-93 (спецификация ПО).
- Анализировать риски ИИ по OWASP Top 10 for LLMs.
Ошибка 1: «Гугловский подход = эталон»
Студенты копируют интерфейс или логику Google, не анализируя её слабости. В статье прямо сказано: «иногда искажает лица». Это не повод игнорировать, а повод для критики и улучшения.
Как избежать: Включите в работу сравнительный анализ. Покажите, где Google терпит неудачу — и как ваше решение это исправляет.
Ошибка 2: Нет измеримых метрик
«Качество улучшилось» — не аргумент. Нужны цифры: на сколько % вырос SSIM? На сколько снизилось время обработки?
Как избежать: Заложите метрики ещё на этапе проектирования. Используйте ISO/IEC 25010 как шаблон для оценки качества.
FAQ: реальные вопросы студентов
Какой стек выбрать для реализации?
Для генеративных моделей — Python + PyTorch. Бэкенд: FastAPI или Flask. Фронтенд: Streamlit (для прототипа) или Electron (для desktop). Модели: Hugging Face (Stable Diffusion, Real-ESRGAN). Не усложняйте: лучше рабочий MVP, чем «идеальный» проект, который не запустится.
Как оформлять схемы по ГОСТ?
Используйте ГОСТ 19.701-90 (аналог DFD) или ГОСТ Р 57939-2017 (UML). Диаграммы — в черно-белом варианте, с пояснениями. C4 можно адаптировать: главное — читаемость. Не рисуйте 20 стрелок на одном листе.
Где взять данные для тестирования?
Публичные датасеты: FFHQ (лица), LOL Dataset (low-light photos), DPED (сравнение камер). Можно снять 50–100 фото на телефон — главное, указать в работе метод сбора и этику (анонимность).
Как защититься от «это уже сделано»?
Фокусируйтесь на ограничениях Google. Ваш вклад — не повторение, а улучшение: контроль освещения, защита от искажений, локальная обработка. Это и есть научная новизна уровня ВКР.
| Ключевая сущность | Применение в ВКР |
|---|---|
| ISO/IEC 25010 | Оценка качества ПО: применимо к ИИ-редактору (функциональность, удобство, надёжность). |
| OWASP Top 10 for LLMs | Анализ угроз: prompt injection, data leakage, модельные смещения. |
| ГОСТ 34.19-93 | Оформление спецификаций требований к ПО. |
| LPIPS | Метрика качества изображений, чувствительная к визуальным искажениям. |
| C4 Model | Проектирование архитектуры ИИ-системы: от контекста до кода. |
☑ Все задачи из введения решены в главах?
☑ Схемы (UML, C4) соответствуют ГОСТ и пояснены в тексте?
☑ Есть измеримые метрики эффективности (PSNR, SSIM, время)?
☑ Упомянуты ограничения (как у Google) и ваш вклад в их преодоление?
☑ Приложения содержат код, датасеты, инструкции по запуску?
☑ Работа прошла проверку на уникальность (не менее 70%)?
☑ Ссылки на источники — актуальные и корректные (включая статью ZDNet)?
Если вы находитесь на этапе выбора темы или боитесь ошибиться в методологии — у нас есть решение. Наши специалисты помогут сформулировать цель, подобрать стек и построить план защиты. 120 часов поддержки — и вы сдадите ВКР без стресса. Помощь с любой темой: от ML до DevOps.
Источник: I tried Google Photos' new AI Enhance tool: How it crops, relights, and fixes your shots - sometimes (опубликовано 2026-04-07)