Files
DocsGPT/tests/parser/file/test_audio_parser.py
T
Alex 7da46c2bea feat: air-gapped deployment guide, no implicit downloads
- Ship tiktoken's cl100k_base inside the package and build the encoding
  from it, so token counting never downloads anything.
- Default EMBEDDINGS_CACHE_DIR to <data home>/models instead of FastEmbed's
  temp dir, and read tokenizer.json and repo metadata from that cache, so
  a model downloads once and survives reboots.
- TTS_PROVIDER=none and STT_PROVIDER=none switch the speech features off:
  the endpoints return 404, audio files fail to ingest with a clear
  message, /api/config reports tts_available/stt_available, and the UI
  hides the Speak and microphone buttons.
- Drop the Google Fonts Roboto import from the web UI.
- prefetch-models fills the cache the app reads; verify-offline checks the
  packaged encoding.
- Docs: new Air-Gapped Deployment guide, settings and cache notes.
2026-09-15 17:54:24 +01:00

89 lines
2.9 KiB
Python

from unittest.mock import MagicMock, patch
import pytest
from docsgpt.parser.file.audio_parser import AudioParser
from docsgpt.parser.file.base_parser import DocumentParseError
from docsgpt.parser.file.bulk import get_default_file_extractor
from docsgpt.stt.upload_limits import AudioFileTooLargeError
def test_audio_init_parser():
parser = AudioParser()
assert isinstance(parser._init_parser(), dict)
assert not parser.parser_config_set
parser.init_parser()
assert parser.parser_config_set
@patch("docsgpt.stt.upload_limits.settings")
@patch("docsgpt.parser.file.audio_parser.STTCreator.create_stt")
@patch("docsgpt.parser.file.audio_parser.settings")
def test_audio_parser_transcribes_file(
mock_settings, mock_create_stt, mock_limit_settings, tmp_path
):
mock_settings.STT_PROVIDER = "openai"
mock_settings.STT_LANGUAGE = "en"
mock_settings.STT_ENABLE_TIMESTAMPS = False
mock_settings.STT_ENABLE_DIARIZATION = False
mock_limit_settings.STT_MAX_FILE_SIZE_MB = 25
mock_stt = MagicMock()
mock_stt.transcribe.return_value = {"text": "Transcript from audio"}
mock_create_stt.return_value = mock_stt
audio_file = tmp_path / "meeting.wav"
audio_file.write_bytes(b"audio-bytes")
parser = AudioParser()
result = parser.parse_file(audio_file)
assert result == "Transcript from audio"
mock_create_stt.assert_called_once_with("openai")
mock_stt.transcribe.assert_called_once_with(
audio_file,
language="en",
timestamps=False,
diarize=False,
)
@patch("docsgpt.parser.file.audio_parser.STTCreator.create_stt")
@patch("docsgpt.parser.file.audio_parser.settings")
def test_audio_parser_refuses_when_speech_to_text_is_disabled(
mock_settings, mock_create_stt, tmp_path
):
mock_settings.STT_PROVIDER = "none"
audio_file = tmp_path / "meeting.wav"
audio_file.write_bytes(b"audio-bytes")
with pytest.raises(DocumentParseError, match="STT_PROVIDER"):
AudioParser().parse_file(audio_file)
mock_create_stt.assert_not_called()
@patch("docsgpt.stt.upload_limits.settings")
def test_audio_parser_rejects_oversized_files(mock_limit_settings, tmp_path):
mock_limit_settings.STT_MAX_FILE_SIZE_MB = 1
audio_file = tmp_path / "meeting.wav"
audio_file.write_bytes(b"x" * (2 * 1024 * 1024))
parser = AudioParser()
try:
parser.parse_file(audio_file)
except AudioFileTooLargeError as exc:
assert "exceeds" in str(exc)
else:
raise AssertionError("Expected oversized audio file to be rejected")
def test_default_file_extractor_supports_audio_extensions():
extractor = get_default_file_extractor()
assert isinstance(extractor[".wav"], AudioParser)
assert isinstance(extractor[".mp3"], AudioParser)
assert isinstance(extractor[".m4a"], AudioParser)
assert isinstance(extractor[".ogg"], AudioParser)
assert isinstance(extractor[".webm"], AudioParser)