import re

import requests

headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0 Safari/537.36"}

print("=== studytonight cpp mcq structure ===")
r = requests.get("https://www.studytonight.com/cpp/mcq-cpp", headers=headers, timeout=30)
html = r.text
print("len:", len(html))
links = re.findall(r'href="(https://www\.studytonight\.com[^"]*)"', html)
mcq = [l for l in dict.fromkeys(links) if "cpp" in l and "mcq" in l.lower()]
print("cpp mcq links:", len(mcq))
for l in mcq[:10]:
    print("  ", l)
# look at question containers
for pat in ["question", "options", "quiz-question", "qna"]:
    print(pat, html.count(pat))

print()
print("=== engineeringmcqs.blogspot structure ===")
r = requests.get("https://engineeringmcqs.blogspot.com/", headers=headers, timeout=30)
html = r.text
print("len:", len(html))
links = re.findall(r'href="(https://engineeringmcqs\.blogspot\.com[^"]*)"', html)
seen = []
for l in links:
    if l not in seen:
        seen.append(l)
print("internal links:", len(seen))
for l in seen[:20]:
    print("  ", l)