Treatment Effect Identification in Multimodal N-of-1 Trials
Does an acne treatment work for this specific patient? I built automated pipelines that read smartphone skin photos with transfer-learned CNNs and test for treatment effects with a linear mixed model, so the question can be answered without a panel of human raters. Wirkt eine Aknebehandlung bei genau dieser Person? Ich habe automatisierte Pipelines entwickelt, die Smartphone-Hautfotos mit per Transfer Learning trainierten CNNs auswerten und Behandlungseffekte mit einem linearen gemischten Modell testen. So lässt sich die Frage ohne ein Gremium menschlicher Bewerter beantworten.
Population averages don't tell a patient whether their cream works.Durchschnittswerte verraten Patient:innen nicht, ob ihre Creme wirkt.
Randomised controlled trials measure average efficacy. N-of-1 trials flip the lens: one person alternates between treatment and no treatment several times, so the effect is measured for that individual. With smartphones, the outcome can now be a photo instead of a questionnaire score.Randomisierte kontrollierte Studien messen die durchschnittliche Wirksamkeit. N-of-1-Studien drehen die Perspektive um: Eine Person wechselt mehrfach zwischen Behandlung und Pause, sodass der Effekt für genau diese Person gemessen wird. Mit Smartphones kann das Ergebnis heute ein Foto statt eines Fragebogenwerts sein.
Randomised controlled trialRandomisierte kontrollierte Studie
Many patients, one answer: "on average, it works". It can't tell whether a given person responds.Viele Personen, eine Antwort: „Im Durchschnitt wirkt es.“ Ob eine bestimmte Person anspricht, bleibt offen.
Multimodal N-of-1 trialMultimodale N-of-1-Studie
One patient, repeated crossovers, photos as outcomes. The catch is that each trial yields only a few dozen images, far too few to train a deep-learning model from scratch.Eine Person, wiederholte Wechsel, Fotos als Messgröße. Der Haken: Jede Studie liefert nur wenige Dutzend Bilder, viel zu wenige, um ein Deep-Learning-Modell von Grund auf zu trainieren.
Data scarcityDatenknappheit
~48 images per participant. Medical image collection is also constrained by legal and ethical rules.Rund 48 Bilder pro Person. Zudem ist die Erhebung medizinischer Bilder rechtlich und ethisch eingeschränkt.
Costly manual ratingAufwendige manuelle Bewertung
The baseline needs five blinded raters to score every photo, which doesn't scale to a consumer app.Die Referenzanalyse braucht fünf verblindete Bewerter:innen pro Foto, was für eine Consumer-App nicht skaliert.
Image biasBildverzerrungen
Backgrounds, lighting and device settings can mislead a model, so its reasoning has to be inspectable.Hintergrund, Licht und Geräteeinstellungen können ein Modell täuschen, deshalb muss seine Entscheidung nachvollziehbar sein.
16 days, 4 crossover blocks, 1 phone.16 Tage, 4 Wechselblöcke, 1 Smartphone.
Five participants tested either a benzoyl-peroxide cream (A) or a salicylic-acid gel (B). Each 4-day block alternates 2 days without and 2 days with treatment, applied three times daily. Photos followed a strict protocol: same pose, same room lighting, the same phone about 10 cm from the skin.Fünf Personen testeten entweder eine Benzoylperoxid-Creme (A) oder ein Salicylsäure-Gel (B). Jeder 4-Tage-Block wechselt zwischen 2 Tagen ohne und 2 Tagen mit Behandlung, dreimal täglich angewendet. Die Fotos folgten einem festen Protokoll: gleiche Pose, gleiches Raumlicht, dasselbe Smartphone in etwa 10 cm Abstand.
Dataset: HIAlab multimodal N-of-1 acne trials, Hasso Plattner Institute (public).Datensatz: multimodale N-of-1-Aknestudien des HIAlab, Hasso-Plattner-Institut (öffentlich).
Alternating schedule per participantWechselplan pro Person
An end-to-end pipeline: from photo to p‑value.Eine End-to-End-Pipeline: vom Foto zum p‑Wert.
Rather than training on the tiny trial dataset, the models borrow visual knowledge from ImageNet, specialise on a larger clinical acne dataset, and are only then applied to the trial photos. Nothing from the trial leaks into training.Statt auf dem winzigen Studiendatensatz zu trainieren, übernehmen die Modelle visuelles Wissen aus ImageNet, spezialisieren sich auf einem größeren klinischen Akne-Datensatz und werden erst dann auf die Studienfotos angewendet. Kein Studienbild fließt ins Training ein.
Pre-trained CNNVortrainiertes CNN
VGG16, VGG19, DenseNet-121 and ResNet-50, with weights learned on ImageNet's millions of images.VGG16, VGG19, DenseNet-121 und ResNet-50 mit auf ImageNet gelernten Gewichten.
ImageNet weightsClean & maskBereinigen & maskieren
Keep mild vs. moderate acne, extract the skin region of interest, resize to 224×224 and normalise.Leichte vs. moderate Akne, Hautregion extrahieren, auf 224×224 skalieren und normalisieren.
ROI · 224×224Transfer learnTransfer Learning
Train a new classifier head on ACNE04 (random search, dropout, augmentation), then fine-tune the top block at lr 1e-6.Neuen Klassifikator auf ACNE04 trainieren (Random Search, Dropout, Augmentation), dann den obersten Block mit lr 1e-6 feinjustieren.
ACNE04 · 60/20/20Score trial photosStudienfotos bewerten
Apply the fine-tuned model to every N-of-1 photo to get a severity probability, and check its focus with Grad-CAM.Das feinjustierte Modell auf jedes N-of-1-Foto anwenden, um eine Schweregrad-Wahrscheinlichkeit zu erhalten, und den Fokus mit Grad-CAM prüfen.
P(moderate) · Grad-CAMTest the effectEffekt testen
Fit a linear mixed model with AR(1) errors per participant: severity ~ treatment, accounting for day-to-day autocorrelation.Lineares gemischtes Modell mit AR(1)-Fehlern pro Person: Schweregrad ~ Behandlung, unter Berücksichtigung der Autokorrelation zwischen Tagen.
LM AR(1) · α = 0.05Which architectures survive the jump to real-world phone photos?Welche Architekturen überstehen den Sprung zu echten Smartphone-Fotos?
DenseNet-121 and ResNet-50 score highest on the clinical test set but drop sharply on trial photos, a sign of overfitting to ACNE04. The VGG models stay stable across both domains, and robustness to domain shift is what matters in a consumer health product.DenseNet-121 und ResNet-50 erzielen auf dem klinischen Testset die besten Werte, fallen aber bei den Studienfotos stark ab, ein Zeichen von Overfitting auf ACNE04. Die VGG-Modelle bleiben in beiden Domänen stabil, und genau diese Robustheit gegenüber Domänenwechseln zählt in einem Consumer-Health-Produkt.
Mild vs. moderate acne classificationKlassifikation leichte vs. moderate Akne
Trial photos are evaluated with a median-probability threshold to adjust for the distribution shift. Hover a bar for exact values.Studienfotos werden mit einem Median-Schwellenwert bewertet, um die Verteilungsverschiebung auszugleichen. Für genaue Werte mit der Maus über einen Balken fahren.
Show as tableAls Tabelle anzeigen
| Model | AUC ACNE04 | AUC N-of-1 | F1 ACNE04 | F1 N-of-1 |
|---|---|---|---|---|
| VGG16 | 0.72 | 0.70 | 75.3% | 68.4% |
| VGG19 | 0.70 | 0.67 | 73.9% | 69.8% |
| DenseNet-121 | 0.81 | 0.61 | 76.2% | 59.6% |
| ResNet-50 | 0.83 | 0.64 | 65.1% | 62.7% |
Seeing what the model sees.Sehen, was das Modell sieht.
Grad-CAM heatmaps show which pixels drove each prediction. On most participants the models focus on acne-affected skin, which is what a dermatologist would look at. They also reveal failure modes: attention near masked lips (participant 3) or eyes (participant 4). That is the kind of bias a product team needs to catch before launch.Grad-CAM-Heatmaps zeigen, welche Bildbereiche eine Vorhersage bestimmt haben. Bei den meisten Personen konzentrieren sich die Modelle auf von Akne betroffene Haut, also genau dort, wo auch Dermatolog:innen hinschauen. Sie decken aber auch Fehlerquellen auf: Aufmerksamkeit nahe den maskierten Lippen (Person 3) oder Augen (Person 4). Solche Verzerrungen muss ein Produktteam vor dem Launch erkennen.
The automated pipeline recovers the expert finding, without human raters.Die automatisierte Pipeline reproduziert das Ergebnis der Expert:innen, ganz ohne menschliche Bewerter.
The manual baseline (five blinded raters) found that the cream worked for participants 2 and 4. Both transfer-learning pipelines independently detect the effect for participant 2, matching the earlier supervised CNN approach and outperforming the unsupervised one. VGG16's effect estimates point in the same direction as the experts' for all five participants.Die manuelle Referenzanalyse (fünf verblindete Bewerter:innen) fand eine Wirkung bei Person 2 und 4. Beide Transfer-Learning-Pipelines erkennen den Effekt bei Person 2 unabhängig davon. Das entspricht dem früheren überwachten CNN-Ansatz und übertrifft den unüberwachten. Die VGG16-Effektschätzungen zeigen bei allen fünf Personen in dieselbe Richtung wie die der Expert:innen.
p-values for the treatment effect, per participantp-Werte des Behandlungseffekts pro Person
LM AR(1) · α = 0.05| MethodMethode | P1 B | P2 B | P3 A | P4 B | P5 A |
|---|---|---|---|---|---|
| Manual analysisManuelle Analyse5 blinded raters · baseline5 verblindete Bewerter:innen · Referenz | 0.10 | 0.0009 | 0.55 | 0.03 | 0.72 |
| Supervised CNNÜberwachtes CNNFua et al. | 0.61 | 0.002 | 0.84 | 0.87 | 0.76 |
| Unsupervised autoencoderUnüberwachter AutoencoderSchneider et al. | 0.28 | 0.09 | 0.82 | 0.50 | 0.47 |
| Transfer learning · VGG19Transfer Learning · VGG19this thesisdiese Arbeit | 0.012 | <0.0001 | 0.60 | 0.76 | 0.21 |
| Transfer learning · VGG16Transfer Learning · VGG16this thesisdiese Arbeit | 0.35 | 0.0001 | 0.10 | 0.47 | 0.68 |
TakeawaysFazit
Small data is workableKleine Datenmengen reichen
Transfer learning from public clinical datasets makes personalised, photo-based efficacy checks feasible even when each patient contributes only a few dozen images.Transfer Learning aus öffentlichen klinischen Datensätzen macht personalisierte, fotobasierte Wirksamkeitsprüfungen möglich, auch wenn jede Person nur wenige Dutzend Bilder beiträgt.
Robustness over leaderboard scoresRobustheit vor Bestwerten
The best clinical-benchmark models were the least robust on smartphone photos. Validating on real user data matters more than the test-set score.Die besten Modelle im klinischen Benchmark waren bei Smartphone-Fotos am wenigsten robust. Die Validierung mit echten Nutzerdaten zählt mehr als der Testset-Wert.
Explainable and statistically groundedErklärbar und statistisch fundiert
Pairing CNNs with Grad-CAM and mixed-model inference gives a decision you can audit, which is essential for clinical trust and regulatory review.Die Kombination von CNNs mit Grad-CAM und Inferenz über gemischte Modelle liefert nachvollziehbare Entscheidungen, was für klinisches Vertrauen und regulatorische Prüfung unerlässlich ist.
Limitations, stated honestlyGrenzen, offen benannt
- Different grading scales between datasets, with no true binary ground truth for trial photos.Unterschiedliche Bewertungsskalen der Datensätze, kein echter binärer Goldstandard für die Studienfotos.
- Scope limited to mild and moderate acne, which covers the large majority of cases.Beschränkt auf leichte und moderate Akne, die den Großteil der Fälle ausmacht.
- Some significant results not confirmed by experts may be false positives.Einige nicht bestätigte signifikante Ergebnisse könnten falsch positiv sein.
Next stepsNächste Schritte
- Larger, more diverse training data across skin types and tones.Größere, vielfältigere Trainingsdaten über Hauttypen und Hautfarben hinweg.
- Systematic study of how many layers to fine-tune.Systematische Untersuchung, wie viele Schichten feinjustiert werden sollten.
- Vision Transformers (ViTs) as backbones.Vision Transformers (ViTs) als Backbone.
CiteZitieren
Building AI for skin health?Sie entwickeln KI für Hautgesundheit?
I'd be glad to walk you through the work or talk about how it applies to your product.Gerne stelle ich die Arbeit im Detail vor oder bespreche, wie sie sich auf Ihr Produkt übertragen lässt.