Seal Atlas — take 01 „no to dobra"

Jeden take (60.1 s), jedna oś czasu: licznik próbek PCM z capture. Krzywa mowy policzona produkcyjnym Silero VAD (embedded ONNX, config domyślny silnika), słowa pochodzą z SealedSpan.words zrzuconych przez żywy tor Apple-live w replayu — nie z żadnej rekonstrukcji.

20/20słów word-grain ≥75% na mowie
11sealed spans
2spany z per-word pinami
1clock-lie (span 2)
0.5próg Silero

Pełny przebieg — 0…60 s

Góra: obwiednia PCM. Środek: p(mowa) Silero co 32 ms z progiem 0.5 (linia przerywana). Dół: zapieczętowane spany Apple (z pinami słów tam, gdzie SFSpeech oddał segmenty) i segmenty Whispera zmapowane wstecz na ten sam zegar. Najedź na box, żeby zobaczyć tekst i zakres.

0s 5s 10s 15s 20s 25s 30s 35s 40s 45s 50s 55s 60s PCM 44.1 kHz Silero p(mowa) · próg 0.5 Apple · SealedSpan.words span 1: No to dobra teraz generalnie powiem parę słów korzystając z surowej transkrypcji przez co. [0.00–20.00s] mowa 84% #1 span 2: Mamy już pierwsze słowo do analizy czego. [20.00–20.10s] mowa 100% span 3: Ten plik WAV i puścił go na. [20.70–23.49s] mowa 98% #3 ten [20.70–20.94s] mowa 100% plik wave [20.94–21.93s] mowa 100% plik w… i [22.14–22.35s] mowa 75% puścił [22.35–22.92s] mowa 100% puś… go [22.92–23.13s] mowa 100% na [23.13–23.49s] mowa 100% span 4: Nasz and point bo muszę mieć pewność Leksykon działa. [23.49–32.10s] mowa 76% #4 span 5: Więc po prostu będę mówił z dupy. [32.10–35.40s] mowa 48% #5 span 6: To aplikacja. [35.40–37.40s] mowa 95% #6 span 7: Ta aplikacja. [37.40–39.80s] mowa 50% #7 span 8: Stworzona. [39.80–43.20s] mowa 36% #8 span 9: Duże bazy kodowe przestały być tajemnicą i czarną dziurą dla agentów jaj korzysta z Ruska. [43.98–53.79s] mowa 73% #9 duże [43.98–44.28s] mowa 90% bazy [44.28–44.55s] mowa 100% kodowe [44.55–45.09s] mowa 100% przestały [45.27–45.66s] mowa 85% być [45.66–45.81s] mowa 100% tajemnicą [45.81–46.59s] mowa 100% taje… i [46.59–47.31s] mowa 100% i czarną [47.79–48.15s] mowa 75% dziurą [48.15–48.57s] mowa 100% dla [49.20–49.89s] mowa 100% dla agentów [49.89–50.25s] mowa 100% jaj [50.25–50.52s] mowa 100% korzysta [52.20–52.62s] mowa 100% z Ruska [52.62–53.79s] mowa 100% z Ruska span 10: W wersji dwa. [53.79–57.30s] mowa 69% #10 span 11: 000. [57.30–57.50s] mowa 43% Whisper · whisper_words No to dobra. Teraz generalnie powiem parę słów, korzystając z surowej transkrypcji przez CodeScribe. [1.00–11.56s] Mamy już pierwsze słowo do analizy, wobec czego chcę, żebyś za chwilę dam [11.56–19.98s] żebyś wziął ten blik wave [20.10–21.96s] i puścił go na [21.96–23.48s] nasz endpoint, bo muszę mieć pewność, [25.49–27.51s] czy leksykon działa. [27.67–29.53s] Więc po prostu [31.33–32.09s] co tam obliwstwoj. [32.10–35.08s] Log3 to aplikacja [35.40–37.38s] toż ona. [38.90–39.78s] po to, aby [40.30–43.18s] Duże bazy kodowe przestały być tajemnicą i czarną dziurą dla agentów AI. [43.70–50.42s] Korzystam z Rusta. [52.12–53.78s] w wersji Tooltrain 2024. [54.79–57.29s]
Silero p(mowa) span word-grain (piny słów) span utterance-grain (1 segment) clock-lie whisper_words

Zoom: span 3 — „Ten plik WAV i puścił go na" (20.7–23.5 s)

6 słów, każde z własnym zakresem próbek. Podział na litery wewnątrz słowa to równomierna interpolacja (SFSpeech nie daje timingów grafemów) — jawnie oznaczona, nie pomiar.

21s 22s 23s PCM 44.1 kHz Silero p(mowa) · próg 0.5 Apple · SealedSpan.words span 3: Ten plik WAV i puścił go na. [20.70–23.49s] mowa 98% #3 ten [20.70–20.94s] mowa 100% t e n plik wave [20.94–21.93s] mowa 100% p l i k w a v e i [22.14–22.35s] mowa 75% i puścił [22.35–22.92s] mowa 100% p u ś c i ł go [22.92–23.13s] mowa 100% g o na [23.13–23.49s] mowa 100% n a span 4: Nasz and point bo muszę mieć pewność Leksykon działa. [23.49–32.10s] mowa 76% #4 Whisper · whisper_words żebyś wziął ten blik wave [20.10–21.96s] i puścił go na [21.96–23.48s]

Zoom: span 9 — 14 słów (44.0–53.8 s)

Najdłuższy word-grain span take'a. Widać przerwy między słowami pokrywające się z dolinami Silero („czarną" zaczyna się po 480 ms ciszy — VAD i pin zgadzają się co do niej).

44s 45s 46s 47s 48s 49s 50s 51s 52s 53s 54s PCM 44.1 kHz Silero p(mowa) · próg 0.5 Apple · SealedSpan.words span 9: Duże bazy kodowe przestały być tajemnicą i czarną dziurą dla agentów jaj korzysta z Ruska. [43.98–53.79s] mowa 73% #9 duże [43.98–44.28s] mowa 90% d u ż e bazy [44.28–44.55s] mowa 100% b a z y kodowe [44.55–45.09s] mowa 100% k o d o w e przestały [45.27–45.66s] mowa 85% być [45.66–45.81s] mowa 100% tajemnicą [45.81–46.59s] mowa 100% t a j e m n i c ą i [46.59–47.31s] mowa 100% i czarną [47.79–48.15s] mowa 75% dziurą [48.15–48.57s] mowa 100% d z i u r ą dla [49.20–49.89s] mowa 100% d l a agentów [49.89–50.25s] mowa 100% jaj [50.25–50.52s] mowa 100% j a j korzysta [52.20–52.62s] mowa 100% z Ruska [52.62–53.79s] mowa 100% z R u s k a span 10: W wersji dwa. [53.79–57.30s] mowa 69% #10 Whisper · whisper_words Duże bazy kodowe przestały być tajemnicą i czarną dziurą dla agentów AI. [43.70–50.42s] Korzystam z Rusta. [52.12–53.78s]

Każde słowo word-grain vs Silero

Udział chunków z p(mowa) ≥ 0.5 wewnątrz zakresu słowa.

span słowo zakres [s] czas mowa
#3 ten 20.70–20.94 240 ms 100%
#3 plik wave 20.94–21.93 990 ms 100%
#3 i 22.14–22.35 210 ms 75%
#3 puścił 22.35–22.92 570 ms 100%
#3 go 22.92–23.13 210 ms 100%
#3 na 23.13–23.49 360 ms 100%
#9 duże 43.98–44.28 300 ms 90%
#9 bazy 44.28–44.55 270 ms 100%
#9 kodowe 44.55–45.09 540 ms 100%
#9 przestały 45.27–45.66 390 ms 85%
#9 być 45.66–45.81 150 ms 100%
#9 tajemnicą 45.81–46.59 780 ms 100%
#9 i 46.59–47.31 720 ms 100%
#9 czarną 47.79–48.15 360 ms 75%
#9 dziurą 48.15–48.57 420 ms 100%
#9 dla 49.20–49.89 690 ms 100%
#9 agentów 49.89–50.25 360 ms 100%
#9 jaj 50.25–50.52 270 ms 100%
#9 korzysta 52.20–52.62 420 ms 100%
#9 z Ruska 52.62–53.79 1170 ms 100%

Uczciwe wnioski

Źródła: CODESCRIBE_SEAL_ATLAS_DUMP (nowa powierzchnia dowodowa w apple_live_session) + vad_atlas_probe (nowy example w core). Sesja replay cff0817b…, sample_rate 44100 Hz, 2650112 próbek.