xmltv_parser.py 13 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315316317318319320321322323324325326327328329330331332333334335336337338339340341342343344345346347348349350351352353354355356357358359360361362363364365366367368369370371372373374375376377378379380381
  1. # -*- coding: utf-8 -*-
  2. """
  3. XMLTV-Parser fuer EPG-Daten.
  4. Parst XMLTV-XML-Dateien speichereffizient via iterparse und wandelt
  5. Sendungsdaten in interne Programm-Dicts um.
  6. """
  7. from __future__ import annotations
  8. import io
  9. import re
  10. from datetime import datetime, timedelta, timezone
  11. from pathlib import Path
  12. from xml.etree.ElementTree import iterparse
  13. from trixy_core.utils.debug import pdebug, perror, pwarn
  14. from plugins.tv_program.epg.channels import ChannelMapper
  15. # Regex fuer XMLTV-Zeitformat: "YYYYMMDDHHmmss +HHMM"
  16. _XMLTV_TIME_RE = re.compile(
  17. r"(\d{4})(\d{2})(\d{2})(\d{2})(\d{2})(\d{2})\s*([+-]\d{4})"
  18. )
  19. # Genre-Kategorien fuer Typ-Erkennung
  20. _FILM_GENRES = {"spielfilm", "film", "kinofilm", "fernsehfilm", "tv-film", "movie"}
  21. _SERIE_GENRES = {"serie", "series", "soap", "telenovela", "sitcom", "dramedy"}
  22. _SHOW_GENRES = {"show", "unterhaltung", "entertainment", "gameshow", "talkshow", "reality"}
  23. _DOKU_GENRES = {"dokumentation", "doku", "documentary", "reportage", "wissen"}
  24. _SPORT_GENRES = {"sport", "fussball", "football", "tennis", "formel 1", "motorsport"}
  25. _NEWS_GENRES = {"nachrichten", "news", "magazin", "journal"}
  26. _KIDS_GENRES = {"kinder", "zeichentrick", "animation", "anime", "children"}
  27. class XMLTVParser:
  28. """
  29. Parser fuer XMLTV-Daten (Standard-EPG-Format).
  30. Nutzt iterparse fuer speichereffizientes Parsen grosser XML-Dateien.
  31. Konvertiert nur Sendungen von Sendern, die im ChannelMapper registriert sind.
  32. """
  33. def __init__(self, channel_mapper: ChannelMapper) -> None:
  34. """
  35. Args:
  36. channel_mapper: Mapper zur Aufloesung von XMLTV-Sender-IDs.
  37. """
  38. self._mapper = channel_mapper
  39. # Mapping: XMLTV channel-id (z.B. "76740") → interner channel_id (z.B. "rtl")
  40. # Wird beim Parsen aus <channel> Elementen aufgebaut
  41. self._xmltv_id_map: dict[str, str] = {}
  42. def parse_file(self, path: Path) -> list[dict]:
  43. """
  44. Parst eine XMLTV-Datei und gibt eine Liste von Programm-Dicts zurueck.
  45. Args:
  46. path: Pfad zur XMLTV-XML-Datei.
  47. Returns:
  48. Liste der geparsten Sendungen.
  49. """
  50. if not path.exists():
  51. perror(f"XMLTVParser: Datei nicht gefunden: {path}")
  52. return []
  53. pdebug(f"XMLTVParser: Parse Datei {path}")
  54. programs: list[dict] = []
  55. self._xmltv_id_map = {}
  56. try:
  57. for event, elem in iterparse(str(path), events=("end",)):
  58. if elem.tag == "channel":
  59. self._map_channel_element(elem)
  60. elem.clear()
  61. elif elem.tag == "programme":
  62. program = self._parse_programme(elem)
  63. if program is not None:
  64. programs.append(program)
  65. elem.clear()
  66. except Exception as e:
  67. perror(f"XMLTVParser: Fehler beim Parsen von {path}: {e}")
  68. pdebug(f"XMLTVParser: {len(programs)} Sendungen aus {path.name} geparst")
  69. return programs
  70. def parse_bytes(self, data: bytes) -> list[dict]:
  71. """
  72. Parst XMLTV-Daten aus einem Byte-Buffer.
  73. Args:
  74. data: Rohe XML-Bytes.
  75. Returns:
  76. Liste der geparsten Sendungen.
  77. """
  78. programs: list[dict] = []
  79. self._xmltv_id_map = {}
  80. try:
  81. stream = io.BytesIO(data)
  82. for event, elem in iterparse(stream, events=("end",)):
  83. if elem.tag == "channel":
  84. # Channel-Element: XMLTV-ID → Display-Name → interner channel_id
  85. self._map_channel_element(elem)
  86. elem.clear()
  87. elif elem.tag == "programme":
  88. program = self._parse_programme(elem)
  89. if program is not None:
  90. programs.append(program)
  91. elem.clear()
  92. except Exception as e:
  93. perror(f"XMLTVParser: Fehler beim Parsen der Byte-Daten: {e}")
  94. pdebug(
  95. f"XMLTVParser: {len(programs)} Sendungen aus Byte-Daten geparst "
  96. f"({len(self._xmltv_id_map)} Sender zugeordnet)"
  97. )
  98. return programs
  99. def _map_channel_element(self, elem) -> None:
  100. """
  101. Mappt ein <channel>-Element auf einen internen Sender.
  102. XMLTV-Quellen nutzen unterschiedliche ID-Formate:
  103. - Domain-basiert: "DasErste.de", "RTL.de"
  104. - Numerisch: "76740", "76762"
  105. In beiden Faellen versuchen wir den Display-Name
  106. ueber den ChannelMapper aufzuloesen.
  107. """
  108. xmltv_id = elem.get("id", "")
  109. if not xmltv_id:
  110. return
  111. # Zuerst direkte XMLTV-ID-Aufloesung versuchen (Domain-Format)
  112. channel_id = self._mapper.resolve_xmltv_id(xmltv_id)
  113. if channel_id:
  114. self._xmltv_id_map[xmltv_id] = channel_id
  115. return
  116. # Fallback: Display-Name ueber resolve() matchen
  117. display_name_elem = elem.find("display-name")
  118. if display_name_elem is not None and display_name_elem.text:
  119. display_name = display_name_elem.text.strip()
  120. channel_id = self._mapper.resolve(display_name)
  121. if channel_id:
  122. self._xmltv_id_map[xmltv_id] = channel_id
  123. pdebug(f"XMLTVParser: '{display_name}' (ID={xmltv_id}) → {channel_id}")
  124. def _parse_programme(self, elem) -> dict | None:
  125. """
  126. Parst ein einzelnes <programme>-Element in ein Programm-Dict.
  127. Args:
  128. elem: Das XML-Element <programme>.
  129. Returns:
  130. Programm-Dict oder None, wenn der Sender nicht bekannt ist.
  131. """
  132. # XMLTV-Sender-ID pruefen (nutzt vorab aufgebaute Map)
  133. xmltv_channel = elem.get("channel", "")
  134. channel_id = self._xmltv_id_map.get(xmltv_channel)
  135. if channel_id is None:
  136. # Fallback: direkte XMLTV-ID-Aufloesung (Domain-Format)
  137. channel_id = self._mapper.resolve_xmltv_id(xmltv_channel)
  138. if channel_id is None:
  139. return None
  140. # Start- und Endzeit parsen
  141. start_str = elem.get("start", "")
  142. stop_str = elem.get("stop", "")
  143. if not start_str:
  144. return None
  145. try:
  146. start_iso = self._parse_xmltv_time(start_str)
  147. except ValueError:
  148. pwarn(f"XMLTVParser: Ungueltiges Startzeit-Format: {start_str}")
  149. return None
  150. stop_iso = ""
  151. if stop_str:
  152. try:
  153. stop_iso = self._parse_xmltv_time(stop_str)
  154. except ValueError:
  155. pass
  156. # Titel (Pflichtfeld)
  157. title_elem = elem.find("title")
  158. if title_elem is None or not title_elem.text:
  159. return None
  160. title = title_elem.text.strip()
  161. # Optionale Felder
  162. subtitle = ""
  163. sub_elem = elem.find("sub-title")
  164. if sub_elem is not None and sub_elem.text:
  165. subtitle = sub_elem.text.strip()
  166. description = ""
  167. desc_elem = elem.find("desc")
  168. if desc_elem is not None and desc_elem.text:
  169. description = desc_elem.text.strip()
  170. # Kategorien sammeln
  171. categories: list[str] = []
  172. for cat_elem in elem.findall("category"):
  173. if cat_elem.text:
  174. categories.append(cat_elem.text.strip())
  175. # Episoden-Informationen (xmltv_ns: 0-basiert!)
  176. season: int | None = None
  177. episode: int | None = None
  178. ep_num_elem = elem.find("episode-num")
  179. if ep_num_elem is not None and ep_num_elem.text:
  180. system = ep_num_elem.get("system", "")
  181. if system == "xmltv_ns":
  182. season, episode = self._parse_episode_ns(ep_num_elem.text)
  183. # Wiederholung oder Premiere
  184. is_premiere = elem.find("previously-shown") is None
  185. # Wenn <premiere> vorhanden, ist es definitiv eine Premiere
  186. if elem.find("premiere") is not None:
  187. is_premiere = True
  188. # Altersfreigabe
  189. rating = ""
  190. rating_elem = elem.find("rating")
  191. if rating_elem is not None:
  192. value_elem = rating_elem.find("value")
  193. if value_elem is not None and value_elem.text:
  194. rating = value_elem.text.strip()
  195. # Produktionsjahr
  196. year = ""
  197. date_elem = elem.find("date")
  198. if date_elem is not None and date_elem.text:
  199. year = date_elem.text.strip()
  200. # Typ anhand der Kategorien und des Titels ermitteln
  201. program_type = self._detect_type(categories, title)
  202. # Programm-Dict zusammenbauen
  203. program: dict = {
  204. "ch": channel_id,
  205. "t": title,
  206. "s": start_iso,
  207. "e": stop_iso,
  208. "pr": is_premiere,
  209. "ty": program_type,
  210. }
  211. # Optionale Felder nur setzen, wenn vorhanden
  212. if subtitle:
  213. program["et"] = subtitle
  214. if description:
  215. program["d"] = description
  216. if categories:
  217. program["g"] = categories
  218. if season is not None:
  219. program["sn"] = season
  220. if episode is not None:
  221. program["ep"] = episode
  222. if rating:
  223. program["rt"] = rating
  224. if year:
  225. program["yr"] = year
  226. # Sprach-Info: Deutsches TV ist fast immer synchronisiert
  227. # Wird spaeter durch Enrichment (AniList/Streaming) ergaenzt
  228. program["lang"] = "de" # Audio-Sprache (de = deutsche Synchro)
  229. # "sub" wird nur gesetzt wenn bekannt (z.B. bei OmU-Sendungen)
  230. return program
  231. @staticmethod
  232. def _parse_xmltv_time(time_str: str) -> str:
  233. """
  234. Konvertiert XMLTV-Zeitformat in ISO 8601.
  235. XMLTV-Format: "YYYYMMDDHHmmss +HHMM"
  236. Ergebnis: ISO 8601 String mit Zeitzone, z.B. "2026-04-11T20:15:00+02:00"
  237. Args:
  238. time_str: Zeitstring im XMLTV-Format.
  239. Returns:
  240. ISO 8601 Zeitstring.
  241. Raises:
  242. ValueError: Bei ungueltigem Format.
  243. """
  244. match = _XMLTV_TIME_RE.match(time_str.strip())
  245. if not match:
  246. raise ValueError(f"Ungueltiges XMLTV-Zeitformat: {time_str}")
  247. year, month, day = int(match.group(1)), int(match.group(2)), int(match.group(3))
  248. hour, minute, second = int(match.group(4)), int(match.group(5)), int(match.group(6))
  249. tz_str = match.group(7)
  250. # Zeitzone parsen: "+0200" -> timedelta(hours=2)
  251. tz_sign = 1 if tz_str[0] == "+" else -1
  252. tz_hours = int(tz_str[1:3])
  253. tz_minutes = int(tz_str[3:5])
  254. tz_offset = timezone(timedelta(hours=tz_sign * tz_hours, minutes=tz_sign * tz_minutes))
  255. dt = datetime(year, month, day, hour, minute, second, tzinfo=tz_offset)
  256. return dt.isoformat()
  257. @staticmethod
  258. def _detect_type(categories: list[str], title: str) -> str:
  259. """
  260. Erkennt den Sendungstyp anhand der Kategorien und des Titels.
  261. Args:
  262. categories: Liste der XMLTV-Kategorien.
  263. title: Titel der Sendung.
  264. Returns:
  265. Typ-String: "film", "serie", "show", "doku", "sport",
  266. "news", "kids" oder "other".
  267. """
  268. # Kategorien normalisieren
  269. normalized_cats = {cat.lower() for cat in categories}
  270. # Priorisierte Erkennung
  271. if normalized_cats & _FILM_GENRES:
  272. return "film"
  273. if normalized_cats & _SERIE_GENRES:
  274. return "serie"
  275. if normalized_cats & _KIDS_GENRES:
  276. return "kids"
  277. if normalized_cats & _SPORT_GENRES:
  278. return "sport"
  279. if normalized_cats & _DOKU_GENRES:
  280. return "doku"
  281. if normalized_cats & _NEWS_GENRES:
  282. return "news"
  283. if normalized_cats & _SHOW_GENRES:
  284. return "show"
  285. # Heuristik: Anime oft als Kategorie erwaehnt
  286. if "anime" in normalized_cats:
  287. return "kids"
  288. return "other"
  289. @staticmethod
  290. def _parse_episode_ns(text: str) -> tuple[int | None, int | None]:
  291. """
  292. Parst xmltv_ns Episodennummerierung.
  293. Format: "season.episode." (0-basiert) -> +1 fuer menschliche Nummerierung.
  294. Args:
  295. text: Der xmltv_ns-String, z.B. "2.15."
  296. Returns:
  297. Tuple (season, episode), jeweils 1-basiert oder None.
  298. """
  299. parts = text.strip().split(".")
  300. season: int | None = None
  301. episode: int | None = None
  302. if len(parts) >= 1 and parts[0].strip():
  303. try:
  304. season = int(parts[0].strip()) + 1
  305. except ValueError:
  306. pass
  307. if len(parts) >= 2 and parts[1].strip():
  308. try:
  309. episode = int(parts[1].strip()) + 1
  310. except ValueError:
  311. pass
  312. return season, episode