Saved searches
Use saved searches to filter your results more quickly
Cancel Create saved search
You signed in with another tab or window. Reload to refresh your session. You signed out in another tab or window. Reload to refresh your session. You switched accounts on another tab or window. Reload to refresh your session.
Have a question about this project? Sign up for a free GitHub account to open an issue and contact its maintainers and the community.
By clicking “Sign up for GitHub”, you agree to our terms of service and privacy statement. We’ll occasionally send you account related emails.
Already on GitHub? Sign in to your account
v1.44 — 3080Ti — GPU is lost. Reboot the system to recover this GPU #1197
charnet3d opened this issue Feb 10, 2022 · 3 comments
v1.44 — 3080Ti — GPU is lost. Reboot the system to recover this GPU #1197
charnet3d opened this issue Feb 10, 2022 · 3 comments
Comments
charnet3d commented Feb 10, 2022
Hi,
Today I have been plagued by this issue. While testing some higher frequencies around 1500mhz (+/- 60mhz) to find the perfect balance of ETH and TON, I started losing the gpu. My setup is just a gaming PC with a 1070 on 2nd slot that I mine on and also use for the display when mining (to improve LHR stability).
Frankly I don’t remember if I had the gpu disconnection starting to occur right before I upgraded to 1.44 or after. But one thing is sure: The last 3 hours I’ve been trying to make v1.44 work but I keep encountering this issue after some time (or very quickly at high frequencies like 1600mhz).
I reverted now to 1.43 and it’s been mining away very stable for 30mins+ at 1500mhz, giving 83.85Mh/s and 2.584Gh/s.
From the Nvidia forums I saw that gpus disappearing like that could be either bad thermals or the psu. As my card runs quite cool, core never exceeding 60c when mining and I had the pads changed for the mem, which makes it run at < 90c at high fan RPM. This leaves the power supply issue. But as now 1.43 is working fine, I'm thinking maybe there is some kind of spiky power usage happening on the newer version that makes the gpu fail hard and disconnect itself.
We need more people to shime in to be able to root out the cause of this.
Also the youtuber CryptoDonkeyMiner had a similar thing happen, https://www.youtube.com/post/UgkxBsVSd7eK57eMFm3NTq2VaR9Sc5iJ7xiH
He said he was testing ETH+ALPH where he noticed only one card showing, but after rebooting hiveOS he couldn’t post, he had to check his rig and then he concluded that his 3080Ti is dead (similar to my issue, even bios couldn’t recognize it anymore and the leds not turning on. I could only resurrect my card when I disconnect all power for a few minutes) CryptoDonkey had to test his card on another machine to finally see that it wasn’t dead.
This COULD be caused by lolminer if it was run before on that card or maybe the same bug on Trex.
The text was updated successfully, but these errors were encountered:
Как устранить ошибку GPU driver error no temps в HIVE OS

Операционная система для майнинга HiveOS отличается высоким уровнем удобства и надежностью благодаря использованию ядра Linux.
Иногда при майнинге возникает ошибка, связанная с отсутствием информации об ошибках драйвера, невозможностью получить информацию о температуре видеокарты, а также проблемах с управлением вентиляторами. При этом работа рига нестабильна, сопровождается зависаниями и перезагрузками:

Она может возникать из-за различных причин, включая переразгон, перегрев, плохой контакт видеокарты с райзером/материнской платой, некорректная установка/”слетание” драйверов, программный/системный сбой и т.д.
Пример ошибки GPU driver error no temps, появляющейся на компьютере под управлением HiveOS при майнинге на видеокартах AMD Radeon RX6600:

Ошибка GPU driver error no temps часто бывает связана с некорректной работой драйвера. При этом в логах (доступны после нажатия на интерактивный текст ошибки в ) можно увидеть информацию о проблемной видеокарте (ее BUS ID, в приведенном ниже примере число 0000.04.00.0, которое соответствует GPU1 на скрине работы майнера выше):

Приведенная в качестве этого примера GPU driver, error no temps ошибка была “вылечена” путем повторной записи образа системы на USB-носитель. Из-за плохого качества флешек, которые подвергаются постоянной нагрузке (запись логов) со временем появляется все большее количество сбоев.
Еще один пример лога, приводящего к сбоям майнера с ошибкой GPU driver, error no temps:

В этом случае проблемы с работой видеокарт AMD Radeon RX580 были вылечены с помощью снижения их температуры (увеличена скорость вращения вентиляторов).
Что делать при появлении ошибки GPU driver error, no temps?
Чтобы точнее узнать причины проблемы, связанной с отсутствием данных о температуре видеокарты, следует ознакомиться с системными логами, а также полным отчетом о работе майнера.
Логи майнера (файл lastrun_noappend.log) обычно находятся в папке /var/log/miner/xxxx/*.log (ознакомиться с ними можно в программе mc), например:

Просмотр части отчета доступен по команде
tail -n 100 /var/log/miner/название_майнера/lastrun_noappend.log
где 100 – количество последних отображаемых строк отчета майнера о работе.
Главный отчет системы доступен по команде
less /var/log/syslog
При нажатии shift-f будет отображен конец отчета syslog.
Системные загрузочные логи можно просмотреть консольной командой
journalctl -u hive
Чтобы посмотреть сообщения при загрузке системы, текущее состояние ядра или ошибки в драйверах, можно использовать команду
dmesg
Изучение этого файла отчета может помочь устранению множества проблем и ошибок. Фрагмент лога, отображаемого по команде dmesg:

Устранению проблемы, связанной с ошибкой GPU driver, error no temps могут помочь следующие способы:
- снижение разгона, в особенности по памяти;
- уменьшение рабочей температуры видеокарты, в особенности в области VRAM. Для этого нужно регулярно проводить чистку карты, а при необходимости – смену термопасты и термопрокладок;
- проверка/замена райзеров, кабелей подключения к материнской плате, обеспечение хорошего контакта с разъемом PCI-E (использование термоклея, специальных заглушек и т.д.);
- проверка/замена кабелей питания и их разъемов на следы перегева, потемнения изоляции, ее расплавления ит.д.:

- проверка файловой системы на ошибки, либо повторная запись образа HiveOS/замена флешки с системой;
- обновление/откат драйверов, переход на более новую/стабильную версию HiveOS.
Вам также может понравиться

Что нужно учитывать при подсчете дохода от майнинга?

19 января, 2020